每次调查 15-20 个来源

语义搜索

使用自然语言描述查找人员

语义搜索 pipeline diagram

语义搜索理解自然语言查询背后的意图和上下文含义,以找到符合特定条件的人员。与基于关键词的搜索不同,Seme 的语义搜索解释复杂描述,如"2018 年至 2022 年间在腾讯 AI 实验室工作的所有研究人员",并在多个数据源中发现匹配的个人——即使不存在精确的关键词匹配。系统使用多阶段流水线:首先,大语言模型将自然语言查询解析为结构化搜索参数(角色、组织、时间段、地点、技能、资历级别);然后,并行搜索代理同时查询 8-12 个平台(LinkedIn、Google Scholar、GitHub、Twitter/X、ResearchGate、ORCID、公共记录和新闻档案);最后,使用复合评分算法对结果进行排名,该算法加权语义相似性(40%)、来源权威性(25%)、数据新鲜度(20%)和来源间交叉验证(15%)。这种方法能发现基于关键词的平台完全遗漏的候选人——例如,找到曾以某机构名义发表论文但从未更新 LinkedIn 档案的研究人员,或识别参加过特定会议但未在网上明确列出该经历的专业人士。每个搜索结果包含匹配置信度分数和来源引用,用户可以点击任何候选人触发完整的深度研究调查,生成带有信任分数的完整身份档案。

技术架构与工作原理

语义搜索 构建在现代 AI 基础设施之上,利用深度学习、自然语言处理和分布式搜索技术提供高精度结果。系统采用微服务架构,将查询解析、数据检索、结果排序和档案生成分离为独立的服务组件,确保每个阶段都可以独立扩展和优化。前端使用 Next.js 16 的 Server Components 实现服务端渲染,确保 AI 爬虫和搜索引擎可以完整索引所有内容。后端部署在 Cloudflare Workers 全球边缘网络上,确保从任何地理位置都能获得低延迟响应。

数据检索层整合了多个搜索提供者,包括 SearXNG 元搜索引擎(聚合 70+ 个搜索源)、OpenAI Web Search API、以及专门的学术和社交媒体数据源。每个查询并行发送到多个搜索代理,结果在汇总层进行去重、排序和交叉验证。系统使用向量嵌入(128-512 维)进行语义相似度匹配,结合余弦相似度算法确保匹配精度。对于身份验证场景,系统额外使用生物识别特征比对和时间线一致性检查。

报告生成阶段使用 GPT-4 进行结构化输出合成,将原始事实转换为带有证据分级(E1-E5)的调查档案。每个事实都标注来源 URL、采集时间和验证状态。信任分数基于三个核心因素计算:来源质量(一手权威来源权重最高)、交叉验证率(多源佐证的事实占比)和信息完整度(关键维度覆盖度)。最终档案包含八个结构化部分:背景教育、工作经历、社交档案、关联关系、时间线、关系图谱、证据来源和信任评分。

工作流程

描述目标步骤 1AI 意图解析步骤 2并行发现步骤 3排名与评分步骤 4点击调查步骤 5

关键数据

92%
查询解释准确率
8-12
搜索平台数
10-50
平均候选人数
<30 seconds
响应时间

工作原理

1

描述目标

输入您要查找的人的自然语言描述——角色、组织、时间段、技能或任何条件组合。

2

AI 意图解析

AI 模型从您的描述中提取结构化搜索参数:角色、组织、时间段、地点、技能和其他标准。

3

并行发现

多个搜索代理使用提取的参数同时查询 LinkedIn、Google Scholar、GitHub、Twitter 和公共记录。

4

排名与评分

结果按语义相似性、来源权威性、数据新鲜度和来源间交叉验证进行排名。

5

点击调查

点击任何候选人触发完整的深度研究调查并生成完整的身份档案。

性能对比

查询类型关键词和筛选器自然语言描述理解能力仅精确匹配意图和上下文理解数据源单一平台8-12 个平台同时查询后续行动手动研究一键深度调查传统方法Seme

Seme vs 传统方法

维度传统方法Seme
查询类型关键词和筛选器自然语言描述
理解能力仅精确匹配意图和上下文理解
数据源单一平台8-12 个平台同时查询
后续行动手动研究一键深度调查

应用场景

人才招聘

找到符合特定条件的候选人:"过去 2 年离开 Google Brain 且在 NeurIPS 发表过论文的高级 NLP 工程师。"

竞争情报

映射竞争对手团队和人才流动:"2024 年从 Meta 转到 OpenAI 的所有 AI 研究人员。"

学术研究

发现特定领域的研究人员:"在排名前 50 的大学从事大语言模型对齐研究的教授。"

尽职调查

找到关注人物:"2024 年进行 B 轮融资的金融科技公司的董事会成员。"

安全与合规

Seme 设计时充分考虑了数据安全和隐私合规要求。所有数据传输使用 TLS 1.3 加密,静态数据使用 AES-256 加密。系统仅从公开可用来源收集信息(OSINT 原则),不访问私有数据库或需要授权的内容。调查结果存储在用户的工作空间中,遵循最小权限原则。平台符合 GDPR 数据处理要求,用户可以随时导出或删除其调查数据。

对于企业客户,Seme 支持单点登录(SSO)、审计日志、角色权限管理和数据驻留选项。API 访问使用 OAuth 2.0 认证,所有 API 调用都有速率限制和使用审计。系统定期进行安全审计和渗透测试,确保符合行业安全标准。

行业应用

金融服务

银行和投资公司使用 Seme 进行 KYC/AML 合规检查、反欺诈调查和交易对手尽职调查。系统可以在 10-30 分钟内完成传统方法需要数天的背景调查,显著降低合规成本和风险暴露时间。

法律与调查

律师事务所和调查机构使用 Seme 进行证人背景调查、资产追踪和关联关系分析。结构化档案输出可以直接用于法律文件,所有证据都标注来源和可信度等级。

人力资源

HR 团队使用 Seme 验证候选人的学历、工作经历和专业资质,检测简历造假和虚假陈述。语义搜索功能可以帮助招聘人员发现符合特定条件的被动候选人。

为什么选择 Seme

📊
15-20
每次调查来源数
🎯
78%
平均信任分数
10-30 min
平均调查时间

Seme 已帮助安全团队、记者和人力资源专业人士完成数千次身份调查。与传统背景调查相比,Seme 将调查时间从数天缩短到数分钟,同时提供更全面的数据覆盖和可审计的证据链。

相关资源

了解更多关于身份调查方法论和 OSINT 技术的信息:

常见问题

语义搜索与 LinkedIn 搜索有何不同?

LinkedIn 搜索仅限于其自身平台数据,需要关键词匹配。Seme 的语义搜索跨 8-12 个平台同时解释自然语言意图,理解上下文和关系,并可以根据复杂多条件描述找到人员。

什么类型的查询效果最好?

结合多个条件的查询效果最好:角色+组织+时间段、技能+地点+经验水平,或专业、教育和地理属性的任何组合。标准越具体,结果越有针对性。

我可以直接从搜索结果调查候选人吗?

可以。点击搜索结果中的任何候选人触发完整的深度研究调查。Seme 将自动进行多轮研究、交叉验证发现,并生成带有信任分数的完整身份档案——通常在 10-30 分钟内。

语义搜索查询哪些数据源?

根据查询上下文,Seme 查询 8-12 个平台:LinkedIn(专业档案)、Google Scholar(学术出版物)、GitHub(技术贡献)、Twitter/X(公开声明和网络)、ResearchGate(研究网络)、ORCID(研究人员标识符)、公共记录数据库、新闻档案和会议论文集。系统根据查询类型选择最相关的来源——学术查询优先使用 Scholar 和 ORCID,而专业查询侧重于 LinkedIn 和新闻来源。

Seme 如何处理跨平台的重复结果?

Seme 使用实体解析来合并属于同一人的不同平台档案。系统基于姓名、照片相似性(可用时)、地点重叠、工作经历一致性和电子邮件/用户名模式进行匹配。重复档案被合并为单个候选人卡片,带有组合的来源引用,为您提供每个人跨所有平台的统一视图。