深度研究
多轮 AI 调查生成全面身份档案
深度研究是一种多轮 AI 调查过程,系统地探索被调查对象背景的多个角度。它遵循结构化方法论:研究规划、跨 15-20 个独立来源的并行搜索执行、差距分析、交叉验证(每个事实 2+ 来源)和报告综合。典型调查涉及 3-4 轮,生成包含教育、职业、社交档案、关联关系、时间线、证据分类(E1-E5)和信任分数的结构化档案。调查引擎首先生成研究计划,识别 5-8 个调查角度(专业历史、社交存在、传记数据、教育验证、关联映射、媒体报道、法律记录和财务关联)。每个角度分配给专门的搜索代理,使用 SearXNG 元搜索(聚合 70+ 个搜索源)和 OpenAI Web Search API 并行查询多个来源。每轮之后,差距分析模块评估所有角度的覆盖度,识别缺失信息,并为下一轮生成有针对性的后续查询。交叉验证是核心差异化因素:每个提取的事实都与独立来源进行比较,分类为已证实(2+ 个独立来源)、单一来源(仅 1 个来源)或有争议(来源冲突)。已证实的事实获得高置信度加权(E1 政府来源 5 倍,E2 权威媒体 3 倍,E3 专业平台 2 倍),而单一来源的事实被标记供人工审查。最终信任分数计算为加权平均值:来源质量(40%)、交叉验证率(35%)和 8 个档案部分的信息完整度(25%)。80% 以上表示高置信度且空白最少;60-80% 表示中等置信度且存在一些未验证声明;60% 以下表示存在重大信息空白需要额外调查。
技术架构与工作原理
深度研究 构建在现代 AI 基础设施之上,利用深度学习、自然语言处理和分布式搜索技术提供高精度结果。系统采用微服务架构,将查询解析、数据检索、结果排序和档案生成分离为独立的服务组件,确保每个阶段都可以独立扩展和优化。前端使用 Next.js 16 的 Server Components 实现服务端渲染,确保 AI 爬虫和搜索引擎可以完整索引所有内容。后端部署在 Cloudflare Workers 全球边缘网络上,确保从任何地理位置都能获得低延迟响应。
数据检索层整合了多个搜索提供者,包括 SearXNG 元搜索引擎(聚合 70+ 个搜索源)、OpenAI Web Search API、以及专门的学术和社交媒体数据源。每个查询并行发送到多个搜索代理,结果在汇总层进行去重、排序和交叉验证。系统使用向量嵌入(128-512 维)进行语义相似度匹配,结合余弦相似度算法确保匹配精度。对于身份验证场景,系统额外使用生物识别特征比对和时间线一致性检查。
报告生成阶段使用 GPT-4 进行结构化输出合成,将原始事实转换为带有证据分级(E1-E5)的调查档案。每个事实都标注来源 URL、采集时间和验证状态。信任分数基于三个核心因素计算:来源质量(一手权威来源权重最高)、交叉验证率(多源佐证的事实占比)和信息完整度(关键维度覆盖度)。最终档案包含八个结构化部分:背景教育、工作经历、社交档案、关联关系、时间线、关系图谱、证据来源和信任评分。
工作流程
关键数据
工作原理
提供输入
输入一个人的姓名和任何已知背景——雇主、教育、地点或任何身份信息。
研究规划
AI 设计多角度调查计划,涵盖专业历史、社交存在、传记数据、教育和关联关系。
多轮搜索
3-4 轮并行搜索,跨 SearXNG、Web 搜索 API、学术数据库和社交平台。每轮建立在之前的发现之上。
交叉验证
每个事实都跨独立来源验证。已证实的事实(2+ 来源)获得高置信度;单一来源的事实被标记。
档案交付
接收包含 8 个组件的结构化档案:背景、工作历史、社交档案、关联关系、时间线、证据、关系图谱和信任分数。
性能对比
Seme vs 传统方法
| 维度 | 传统方法 | Seme |
|---|---|---|
| 每次调查来源数 | 1-3 个数据库 | 15-20 个独立来源 |
| 验证方法 | 单一来源查询 | 交叉验证(2+ 来源) |
| 证据分类 | 无 | E1-E5 五级体系 |
| 调查轮次 | 1(静态查询) | 3-4 轮自适应 |
| 完成时间 | 数天到数周 | 10-30 分钟 |
| 输出格式 | 非结构化笔记 | 结构化档案 + 信任分数 |
应用场景
高管招聘
C 级候选人的全面背景调查——验证就业历史、教育、出版物并发现潜在危险信号。
投资尽职调查
投资前调查初创公司创始人和关键人员——验证声称的退出记录、检查诉讼历史、验证资质。
合规筛查
金融机构的 KYC/AML 合规筛查——带来源引用证据的全面背景验证。
调查性新闻
对调查报告对象的深度背景研究——验证声明、映射连接、构建基于证据的档案。
安全与合规
Seme 设计时充分考虑了数据安全和隐私合规要求。所有数据传输使用 TLS 1.3 加密,静态数据使用 AES-256 加密。系统仅从公开可用来源收集信息(OSINT 原则),不访问私有数据库或需要授权的内容。调查结果存储在用户的工作空间中,遵循最小权限原则。平台符合 GDPR 数据处理要求,用户可以随时导出或删除其调查数据。
对于企业客户,Seme 支持单点登录(SSO)、审计日志、角色权限管理和数据驻留选项。API 访问使用 OAuth 2.0 认证,所有 API 调用都有速率限制和使用审计。系统定期进行安全审计和渗透测试,确保符合行业安全标准。
行业应用
金融服务
银行和投资公司使用 Seme 进行 KYC/AML 合规检查、反欺诈调查和交易对手尽职调查。系统可以在 10-30 分钟内完成传统方法需要数天的背景调查,显著降低合规成本和风险暴露时间。
法律与调查
律师事务所和调查机构使用 Seme 进行证人背景调查、资产追踪和关联关系分析。结构化档案输出可以直接用于法律文件,所有证据都标注来源和可信度等级。
人力资源
HR 团队使用 Seme 验证候选人的学历、工作经历和专业资质,检测简历造假和虚假陈述。语义搜索功能可以帮助招聘人员发现符合特定条件的被动候选人。
为什么选择 Seme
Seme 已帮助安全团队、记者和人力资源专业人士完成数千次身份调查。与传统背景调查相比,Seme 将调查时间从数天缩短到数分钟,同时提供更全面的数据覆盖和可审计的证据链。
相关资源
了解更多关于身份调查方法论和 OSINT 技术的信息:
常见问题
深度研究使用多少来源?▾
典型的深度研究调查查询 15-20 个独立来源,跨搜索引擎、社交媒体平台、学术数据库、公共记录和新闻档案。系统执行 3-4 轮搜索,每轮建立在前一轮的发现之上。
什么是信任分数?▾
信任分数是基于来源质量和佐证的 0-100% 置信度百分比。E1 来源(政府记录)权重最高(5 倍),E5 来源(未验证声明)权重最低(0.5 倍)。80% 以上表示高置信度;60-80% 为中等;60% 以下存在重大空白。
我可以自定义调查范围吗?▾
可以。您可以提供额外的上下文来指导调查——要关注的特定方面、要调查的已知组织或要检查的特定时间段。AI 会将您的指导纳入研究计划,同时也会探索标准调查角度。
什么是 E1-E5 证据分类体系?▾
E1-E5 体系按来源可靠性对证据进行分类:E1(政府/官方记录)——最高可靠性,5 倍权重;E2(权威媒体、知名机构)——高可靠性,3 倍权重;E3(LinkedIn 等专业平台、学术数据库)——中等可靠性,2 倍权重;E4(社交媒体、用户生成内容)——较低可靠性,1 倍权重;E5(未验证声明、匿名来源)——最低可靠性,0.5 倍权重。信任分数计算使用这些权重来优先考虑高质量证据。
深度研究如何处理矛盾信息?▾
当系统遇到来自不同来源的矛盾事实时,会在档案中标记为"有争议"。每个矛盾的声明都附有其来源和证据等级,让您可以评估哪个版本更可信。系统优先考虑较高级别的来源(E1-E2)而非较低级别的来源(E4-E5),并注明支持每个版本的来源数量。对于关键矛盾(例如,矛盾的就业日期),系统会生成专门针对解决该矛盾的后续查询。