身份调查术语表
身份调查、开源情报(OSINT)、生物识别和尽职调查中使用的术语和概念定义。
本术语表涵盖身份调查领域的核心概念,包括开源情报方法论、生物识别技术、证据分级体系、信任评分机制和合规框架。每个术语都提供中英双语定义,并关联到 Seme 平台的具体功能和应用场景。术语按类别组织,便于快速查找和理解。
身份调查是一个快速发展的领域,融合了开源情报(OSINT)、人工智能、生物识别和数据分析等多个学科。理解这些专业术语对于有效使用调查工具、解读调查结果和满足合规要求至关重要。Seme 平台将这些概念整合到一个统一的工作流中,使非专业用户也能进行专业的身份调查。无论您是安全分析师、人力资源专业人士、记者还是投资者,掌握这些术语都将帮助您更好地利用 AI 调查工具。
Intelligence
OSINT(开源情报)
OSINT(开源情报)是从公开可用来源收集和分析信息以产生可操作情报的实践。根据 NATO 指南,OSINT 来源包括社交媒体平台、公共记录数据库、新闻档案、学术出版物、政府文件和域名注册记录。在身份调查中,OSINT 综合来自 LinkedIn 档案、公司文件、学术出版物和社交媒体活动的数据,构建全面的背景档案。现代 OSINT 工作流使用 AI 跨 15-20 个独立来源交叉验证发现,实现从 E1(多个相互印证的一手来源)到 E5(单一未验证来源)的验证置信度。美国国防部将 OSINT 定义为"从公开可用来源获取并经过情报技术验证的信息"。
社交媒体情报(SOCMINT)
社交媒体情报(SOCMINT)是 OSINT 的一个专门子集,专注于从社交媒体平台收集和分析信息。SOCMINT 包括监控公开帖子、分析网络连接、跟踪行为模式、从社交档案提取结构化数据以及评估情感和影响力。分析的关键平台包括 Twitter/X、LinkedIn、Facebook、Instagram、Reddit、微博和 TikTok。SOCMINT 与一般社交媒体监控的区别在于其分析深度——它超越跟踪提及,绘制关系网络、识别影响模式、检测行为异常并从社交活动构建时间线叙述。
Technology
人脸搜索
人脸搜索是一种生物识别技术,使用 AI 驱动的深度学习将面部照片与已知人脸数据库进行匹配。现代人脸搜索系统使用卷积神经网络(CNN)如 FaceNet、ArcFace 或 DeepFace 将面部图像转换为高维嵌入向量(通常 128-512 维)。这些嵌入捕获独特的面部特征——眼睛间距、鼻子形状、下巴轮廓和皮肤纹理——即使在光线、角度、表情和老化变化下也能实现匹配。最先进的系统在 LFW(野外标记人脸)等基准数据集上达到 99.5%+ 的准确率。在身份调查中,人脸搜索弥合了拥有照片与知道此人身份之间的鸿沟。
语义搜索
语义搜索是一种搜索方法,理解查询背后的意图和上下文含义,而不仅仅是匹配关键词。与依赖精确术语匹配和 TF-IDF 评分的传统关键词搜索不同,语义搜索使用自然语言理解(NLU)模型——通常是基于 Transformer 的架构如 BERT 或 GPT——来解释查询意图并匹配语义相关的结果。在身份调查中,语义搜索解释自然语言条件,如"2018 年至 2022 年间在腾讯 AI 实验室工作的所有研究人员",以找到符合特定描述的人员,即使数据中不存在精确的关键词匹配。
知识图谱
知识图谱是实体(人员、组织、地点)及其之间关系的网络表示,存储为节点和边的图。在身份调查中,知识图谱可视化研究过程中发现的连接,帮助分析师理解复杂的关联网络。每个节点代表一个具有属性(名称、类型、属性)的实体,每条边代表一种关系(就职于、认识、合著、位于)。知识图谱支持基于图的查询,如"找出同时在 A 公司和 B 公司工作过的所有人"或"识别人员 X 和人员 Y 之间的最短连接路径"。现代调查平台使用包含数千个节点的知识图谱来映射组织结构、影响网络和实体关系。
实体解析
实体解析是确定不同记录或数据点是否指向同一现实世界实体的过程。在身份调查中,实体解析链接跨平台的档案——将 Twitter 用户名与 LinkedIn 档案匹配,将电子邮件地址与真实姓名关联,或将电话号码与多个在线账户关联。这是身份调查中最具挑战性的方面之一,因为人们在不同平台使用不同的名称、用户名和标识符。现代实体解析使用概率匹配算法,考虑多种信号:精确匹配(相同电子邮件、电话)、模糊匹配(相似名称、部分匹配)、行为信号(写作风格、活动模式)和上下文信号(共享连接、重叠时间线)。
数据增强
数据增强是用来自外部来源的附加信息增强现有记录以创建更完整和准确的档案的过程。在身份调查中,从最少的输入开始——姓名、照片或电子邮件地址——增强逐步添加社交档案、就业历史、教育记录、公共记录、联系信息和其他上下文数据。增强过程遵循漏斗模式:从广泛开始(搜索所有可用来源)并根据确认的匹配收窄。每个增强步骤增加整体档案的置信度分数。现代增强平台可以在几分钟内将单个标识符扩展为包含 50+ 字段的全面档案。
生物识别
生物识别使用独特的身体或行为特征来识别和验证个人。身份调查中的主要生物识别模式包括:人脸识别(最常用,使用基于 CNN 的人脸嵌入)、指纹分析(脊线模式匹配)、语音识别(声学特征提取)、虹膜扫描(虹膜模式分析)和步态分析(行走模式识别)。由于社交媒体、监控系统和公共记录中大量可用的面部照片,人脸识别在身份调查中占主导地位。现代人脸识别系统在受控数据集上达到 99.5%+ 的准确率,在真实世界图像上达到 95-98% 的准确率,性能因光照条件、图像质量和人口统计因素而异。
别名检测
别名检测是识别同一人在不同平台和上下文中使用的替代名称、用户名或身份的过程。人们使用别名有各种原因——隐私、专业分离(个人与工作账户)、游戏人物或故意隐瞒。别名检测依赖于五类信号:(1)共享标识符——跨账户匹配电子邮件地址、电话号码或恢复电子邮件;(2)用户名模式——检测相似的命名约定(jdoe、john.doe、johndoe82);(3)行为信号——匹配写作风格、词汇和主题兴趣;(4)视觉信号——通过感知哈希或人脸识别匹配个人资料照片;(5)网络重叠——检测共享连接或社区成员资格。有效的别名检测可以为每个对象发现 3-10 个额外的在线身份。
开源情报工具
开源情报工具是旨在促进 OSINT 收集、处理和分析的软件应用程序和平台。OSINT 工具生态系统包括:搜索聚合器(SearXNG,同时查询多个引擎)、社交媒体分析工具(社交媒体爬虫、档案分析器)、反向图像搜索引擎(Google Images、TinEye、Yandex)、网络分析框架(Maltego、Gephi)、公共记录数据库(PACER、EDGAR、Companies House)、数据可视化平台以及像 Seme 这样的专业调查平台。现代 OSINT 工具越来越多地融入 AI 进行自动化实体提取、关系映射和模式识别,减少全面调查所需的人工工作量。
Methodology
深度研究
深度研究是一种多轮 AI 调查过程,系统地探索被调查对象背景的多个角度以生成全面的身份档案。与单次查询搜索不同,深度研究遵循结构化方法论:研究规划(设计调查角度——专业、社交、传记、教育)、并行搜索执行(跨搜索引擎和数据库同时运行多个查询)、差距分析(评估覆盖范围并生成后续查询)、交叉验证(跨独立来源验证事实)和报告综合(生成结构化档案)。典型的深度研究调查涉及 3-4 轮,每轮建立在前一轮的发现之上,每个对象覆盖 15-20 个独立来源。
调查档案
调查档案是身份调查中所有发现的结构化汇编,旨在以标准化、可审计的格式呈现已验证的事实。完整的档案包含八个核心组件:(1)背景和教育——学术历史、学位、机构、研究方向;(2)工作经历——职业时间线、角色、公司、职责、成就;(3)社交媒体——带有置信度分数的已验证社交档案;(4)联系人和关联——相关人员、组织、从属关系;(5)时间线——按时间顺序排列的关键生活事件及来源引用;(6)关系图谱——实体连接的可视化网络;(7)证据和来源——所有带有 E1-E5 分类的来源 URL;(8)信任分数——基于来源质量和交叉验证的总体置信度百分比。
交叉验证
身份调查中的交叉验证是通过在多个独立来源中确认事实来验证事实的过程。由两个或更多不相关来源支持的事实被视为已证实,并获得高置信度分类。单一来源的事实被标记为较低置信度,可能触发额外的验证搜索。交叉验证遵循三个原则:(1)独立性——来源不得共享共同起源(例如,LinkedIn 帖子和引用该帖子的公司新闻稿算作一个来源,而非两个);(2)一致性——佐证来源必须在关键事实上一致;(3)时效性——对于时间敏感的事实,更近的来源获得更高权重。交叉验证引擎分配置信度级别:高(3+ 独立来源)、中(2 个来源)、低(1 个来源)、有争议(冲突来源)。
证据分类(E1-E5)
证据分类是用于分类身份调查中证据来源可靠性和质量的五级系统。E1(一手来源)包括政府记录、官方文件、法院文件和经验证的机构记录——这些具有最高的证据权重。E2(经验证的二手来源)包括 reputable 新闻文章、已发表的学术论文和经验证的公司公告。E3(社交和用户生成内容)包括经验证的社交媒体帖子、专业档案和公开论坛贡献。E4(未验证来源)包括匿名帖子、未验证的声明和单一来源的指控。E5(最低置信度)包括谣言、推测和来自已知可靠性问题来源的内容。此分类系统使调查人员能够评估其发现的总体置信度并识别需要额外验证的领域。
网络分析
网络分析是研究实体之间的关系和连接,以理解社会结构、信息流和影响模式。在身份调查中,网络分析使用图论指标映射专业关系、组织从属关系和社交连接。关键指标包括:度中心性(直接连接数)、中介中心性(实体位于其他实体之间最短路径上的频率)、聚类系数(实体联系人的互联程度)和特征向量中心性(基于连接实体重要性的连接质量)。网络分析揭示了从检查单个档案中不可见的隐藏结构——例如,一个直接连接适中但中介中心性高的人可能是关键的信息中介。
时间线分析
时间线分析是将发现的事实按时间顺序组织以创建被调查对象生活事件的连贯叙述的过程。在身份调查中,时间线分析将来自多个来源的分散数据点转换为结构化的时间序列,帮助调查人员识别可能需要进一步调查的空白、不一致和模式。构建良好的时间线包括有日期的事件(就业开始/结束、入学/毕业、出版日期、旅行事件)、每个事件的来源引用和置信度指标。时间线分析对于验证不在场证明、检测伪造(不符合时间线的事件)和识别无法解释的活动或不活动时期特别有价值。
Security
身份验证
身份验证是通过交叉引用多个独立数据点来确认一个人是其声称身份的过程。在数字环境中,验证结合生物识别数据(人脸识别、指纹)、文件(政府 ID、学术证书)、行为模式(写作风格、活动模式)和社交信号(专业联系、组织从属关系)来建立对身份的信心。现代身份验证系统使用分层方法:级别 1 检查基本文件有效性,级别 2 与外部数据库交叉引用,级别 3 执行生物识别匹配。置信度以百分比表示,基于佐证来源的数量和质量。
数据泄露
数据泄露是受保护或保密数据被未经授权方访问、披露或窃取的事件。常见泄露类型包括黑客攻击、内部威胁、物理盗窃和意外暴露。泄露数据——通常在暗网市场、粘贴站点和 HaveIBeenPwned 等泄露通知服务上发现——可以是有价值的调查信息来源,但其使用会引发重大伦理和法律考虑。在身份调查中,泄露数据可能揭示别名、电子邮件地址、密码模式、账户关联和先前未知的在线身份。泄露数据的伦理使用需要仔细考虑隐私法、数据保护法规以及公开可用的泄露索引与原始泄露数据之间的区别。
Concepts
数字足迹
数字足迹是一个人在线活动留下的全面数据和信息痕迹。它包括主动足迹(社交媒体帖子、博客文章、论坛评论、档案注册)和被动足迹(Cookie、IP 日志、位置数据、设备指纹)。在身份调查中,分析一个人的数字足迹可以揭示其专业网络、兴趣、位置历史、行为模式和关联关系。典型成年人的数字足迹跨越 15-25 个不同的平台和服务,生成数百个数据点,可聚合为连贯的身份档案。数字足迹按持久性分类:临时性(故事、直播)、半永久性(社交媒体帖子)和永久性(公共记录、存档内容)。
信任分数
信任分数是根据来源的质量、数量和佐证程度为调查档案分配的置信度百分比。分数范围从 0%(无已验证信息)到 100%(所有事实均由多个高质量来源完全佐证)。计算考虑:(1)来源质量——按证据分类层级加权(E1=5 倍、E2=3 倍、E3=2 倍、E4=1 倍、E5=0.5 倍);(2)佐证率——由 2+ 独立来源支持的事实百分比;(3)覆盖完整性——档案各部分包含已验证数据的程度;(4)一致性——无冲突事实。80% 以上的分数表示高置信度,适合决策;60-80% 表示中等置信度,存在一些空白;60% 以下表示存在重大验证空白。
关注人物
关注人物(POI)是因特定原因引起调查人员或分析师注意的个人,但不一定是被怀疑有不当行为的人。在身份调查中,POI 通常是需要验证其背景、需要绘制其联系网络或需要作为更大调查的一部分监控其活动的人。POI 指定是重点调查的起点——它触发数据收集、分析和验证的系统化流程。该术语在多个领域使用:执法(与案件相关的人员)、企业安全(标记进行访问审查的个人)、新闻(调查的来源和主题)和尽职调查(需要背景验证的人员)。
Use Cases
尽职调查
尽职调查是在建立业务关系或交易之前对个人或组织进行的全面评估。现代尽职调查将传统背景调查与 OSINT 技术相结合,以验证资质、评估风险和发现潜在危险信号。在身份调查的背景下,个人尽职调查涵盖:就业验证、教育确认、犯罪记录检查、诉讼历史、财务状况、监管制裁、媒体声誉分析和关联映射。尽职调查深度因用例而异:基本筛查(自动数据库检查)、标准调查(OSINT + 数据库)和增强调查(带交叉验证的多轮深度研究)。KYC/AML 等监管框架强制要求金融服务进行尽职调查,而自愿尽职调查在并购、招聘和合作伙伴决策中很常见。
背景调查
背景调查是对一个人的商业、犯罪、财务和个人记录的系统审查,以验证其身份并评估其可信度。AI 驱动的背景调查超越了传统的数据库查询,通过结合 OSINT 数据、社交媒体分析和交叉引用多个来源进行全面验证。传统背景调查依赖数据库查询(犯罪记录、信用报告、就业验证服务),通常覆盖 5-10 个数据点。AI 增强的背景调查添加了数字足迹分析、社交媒体筛查、网络分析和跨 15-20+ 来源的交叉验证,产生更全面和细致的评估。
竞争情报
竞争情报(CI)是收集和分析有关竞争对手、市场趋势和行业动态信息以支持战略决策的实践。身份调查工具通过绘制公司间的人才流动、组织变革和关键人员网络来支持 CI。与工业间谍不同,竞争情报完全依赖合法和道德的信息来源——公共记录、已发布的报告、社交媒体、专利申请和学术出版物。在身份调查的背景下,CI 专注于理解竞争动态背后的人:谁领导竞争对手团队、他们有什么专业知识、人才如何在公司之间流动以及什么网络连接行业领导者。
Data Sources
平台数据
相关资源
常见问题
什么是 OSINT?▾
OSINT(开源情报)是从公开可用来源收集和分析信息以产生可操作情报的实践。来源包括社交媒体、公共记录、新闻档案、学术出版物和政府文件。
什么是信任分数?▾
信任分数是 0-100% 的置信度指标,基于信息来源质量和交叉验证结果计算。多个独立来源佐证的事实得分更高。
证据分级 E1-E5 是什么?▾
E1-E5 是五级证据分类体系:E1 一手权威来源,E2 新闻报道,E3 社交媒体,E4 匿名来源,E5 未验证声明。