每次调查 15-20 个来源

深度研究

多轮 AI 调查生成全面身份档案

深度研究 pipeline diagram

深度研究是一种多轮 AI 调查过程,系统地探索被调查对象背景的多个角度。它遵循结构化方法论:研究规划、跨 15-20 个独立来源的并行搜索执行、差距分析、交叉验证(每个事实 2+ 来源)和报告综合。典型调查涉及 3-4 轮,生成包含教育、职业、社交档案、关联关系、时间线、证据分类(E1-E5)和信任分数的结构化档案。调查引擎首先生成研究计划,识别 5-8 个调查角度(专业历史、社交存在、传记数据、教育验证、关联映射、媒体报道、法律记录和财务关联)。每个角度分配给专门的搜索代理,使用 SearXNG 元搜索(聚合 70+ 个搜索源)和 OpenAI Web Search API 并行查询多个来源。每轮之后,差距分析模块评估所有角度的覆盖度,识别缺失信息,并为下一轮生成有针对性的后续查询。交叉验证是核心差异化因素:每个提取的事实都与独立来源进行比较,分类为已证实(2+ 个独立来源)、单一来源(仅 1 个来源)或有争议(来源冲突)。已证实的事实获得高置信度加权(E1 政府来源 5 倍,E2 权威媒体 3 倍,E3 专业平台 2 倍),而单一来源的事实被标记供人工审查。最终信任分数计算为加权平均值:来源质量(40%)、交叉验证率(35%)和 8 个档案部分的信息完整度(25%)。80% 以上表示高置信度且空白最少;60-80% 表示中等置信度且存在一些未验证声明;60% 以下表示存在重大信息空白需要额外调查。

调查档案输出示例

技术架构与工作原理

深度研究 构建在现代 AI 基础设施之上,利用深度学习、自然语言处理和分布式搜索技术提供高精度结果。系统采用微服务架构,将查询解析、数据检索、结果排序和档案生成分离为独立的服务组件,确保每个阶段都可以独立扩展和优化。前端使用 Next.js 16 的 Server Components 实现服务端渲染,确保 AI 爬虫和搜索引擎可以完整索引所有内容。后端部署在 Cloudflare Workers 全球边缘网络上,确保从任何地理位置都能获得低延迟响应。

数据检索层整合了多个搜索提供者,包括 SearXNG 元搜索引擎(聚合 70+ 个搜索源)、OpenAI Web Search API、以及专门的学术和社交媒体数据源。每个查询并行发送到多个搜索代理,结果在汇总层进行去重、排序和交叉验证。系统使用向量嵌入(128-512 维)进行语义相似度匹配,结合余弦相似度算法确保匹配精度。对于身份验证场景,系统额外使用生物识别特征比对和时间线一致性检查。

报告生成阶段使用 GPT-4 进行结构化输出合成,将原始事实转换为带有证据分级(E1-E5)的调查档案。每个事实都标注来源 URL、采集时间和验证状态。信任分数基于三个核心因素计算:来源质量(一手权威来源权重最高)、交叉验证率(多源佐证的事实占比)和信息完整度(关键维度覆盖度)。最终档案包含八个结构化部分:背景教育、工作经历、社交档案、关联关系、时间线、关系图谱、证据来源和信任评分。

工作流程

提供输入步骤 1研究规划步骤 2多轮搜索步骤 3交叉验证步骤 4档案交付步骤 5

关键数据

3-4
调查轮次
15-20
每个对象来源数
78%
平均信任分数
10-30 min
完成时间

工作原理

1

提供输入

输入一个人的姓名和任何已知背景——雇主、教育、地点或任何身份信息。

2

研究规划

AI 设计多角度调查计划,涵盖专业历史、社交存在、传记数据、教育和关联关系。

3

多轮搜索

3-4 轮并行搜索,跨 SearXNG、Web 搜索 API、学术数据库和社交平台。每轮建立在之前的发现之上。

4

交叉验证

每个事实都跨独立来源验证。已证实的事实(2+ 来源)获得高置信度;单一来源的事实被标记。

5

档案交付

接收包含 8 个组件的结构化档案:背景、工作历史、社交档案、关联关系、时间线、证据、关系图谱和信任分数。

性能对比

每次调查来源数1-3 个数据库15-20 个独立来源验证方法单一来源查询交叉验证(2+ 来源)证据分类E1-E5 五级体系调查轮次1(静态查询)3-4 轮自适应完成时间数天到数周10-30 分钟输出格式非结构化笔记结构化档案 + 信任分数传统方法Seme

Seme vs 传统方法

维度传统方法Seme
每次调查来源数1-3 个数据库15-20 个独立来源
验证方法单一来源查询交叉验证(2+ 来源)
证据分类E1-E5 五级体系
调查轮次1(静态查询)3-4 轮自适应
完成时间数天到数周10-30 分钟
输出格式非结构化笔记结构化档案 + 信任分数

应用场景

高管招聘

C 级候选人的全面背景调查——验证就业历史、教育、出版物并发现潜在危险信号。

投资尽职调查

投资前调查初创公司创始人和关键人员——验证声称的退出记录、检查诉讼历史、验证资质。

合规筛查

金融机构的 KYC/AML 合规筛查——带来源引用证据的全面背景验证。

调查性新闻

对调查报告对象的深度背景研究——验证声明、映射连接、构建基于证据的档案。

安全与合规

Seme 设计时充分考虑了数据安全和隐私合规要求。所有数据传输使用 TLS 1.3 加密,静态数据使用 AES-256 加密。系统仅从公开可用来源收集信息(OSINT 原则),不访问私有数据库或需要授权的内容。调查结果存储在用户的工作空间中,遵循最小权限原则。平台符合 GDPR 数据处理要求,用户可以随时导出或删除其调查数据。

对于企业客户,Seme 支持单点登录(SSO)、审计日志、角色权限管理和数据驻留选项。API 访问使用 OAuth 2.0 认证,所有 API 调用都有速率限制和使用审计。系统定期进行安全审计和渗透测试,确保符合行业安全标准。

行业应用

金融服务

银行和投资公司使用 Seme 进行 KYC/AML 合规检查、反欺诈调查和交易对手尽职调查。系统可以在 10-30 分钟内完成传统方法需要数天的背景调查,显著降低合规成本和风险暴露时间。

法律与调查

律师事务所和调查机构使用 Seme 进行证人背景调查、资产追踪和关联关系分析。结构化档案输出可以直接用于法律文件,所有证据都标注来源和可信度等级。

人力资源

HR 团队使用 Seme 验证候选人的学历、工作经历和专业资质,检测简历造假和虚假陈述。语义搜索功能可以帮助招聘人员发现符合特定条件的被动候选人。

为什么选择 Seme

📊
15-20
每次调查来源数
🎯
78%
平均信任分数
10-30 min
平均调查时间

Seme 已帮助安全团队、记者和人力资源专业人士完成数千次身份调查。与传统背景调查相比,Seme 将调查时间从数天缩短到数分钟,同时提供更全面的数据覆盖和可审计的证据链。

相关资源

了解更多关于身份调查方法论和 OSINT 技术的信息:

常见问题

深度研究使用多少来源?

典型的深度研究调查查询 15-20 个独立来源,跨搜索引擎、社交媒体平台、学术数据库、公共记录和新闻档案。系统执行 3-4 轮搜索,每轮建立在前一轮的发现之上。

什么是信任分数?

信任分数是基于来源质量和佐证的 0-100% 置信度百分比。E1 来源(政府记录)权重最高(5 倍),E5 来源(未验证声明)权重最低(0.5 倍)。80% 以上表示高置信度;60-80% 为中等;60% 以下存在重大空白。

我可以自定义调查范围吗?

可以。您可以提供额外的上下文来指导调查——要关注的特定方面、要调查的已知组织或要检查的特定时间段。AI 会将您的指导纳入研究计划,同时也会探索标准调查角度。

什么是 E1-E5 证据分类体系?

E1-E5 体系按来源可靠性对证据进行分类:E1(政府/官方记录)——最高可靠性,5 倍权重;E2(权威媒体、知名机构)——高可靠性,3 倍权重;E3(LinkedIn 等专业平台、学术数据库)——中等可靠性,2 倍权重;E4(社交媒体、用户生成内容)——较低可靠性,1 倍权重;E5(未验证声明、匿名来源)——最低可靠性,0.5 倍权重。信任分数计算使用这些权重来优先考虑高质量证据。

深度研究如何处理矛盾信息?

当系统遇到来自不同来源的矛盾事实时,会在档案中标记为"有争议"。每个矛盾的声明都附有其来源和证据等级,让您可以评估哪个版本更可信。系统优先考虑较高级别的来源(E1-E2)而非较低级别的来源(E4-E5),并注明支持每个版本的来源数量。对于关键矛盾(例如,矛盾的就业日期),系统会生成专门针对解决该矛盾的后续查询。