实体解析
作者:Seme 研究团队 · 更新于 2026-05-22
定义
实体解析是确定不同记录或数据点是否指向同一现实世界实体的过程。在身份调查中,实体解析链接跨平台的档案——将 Twitter 用户名与 LinkedIn 档案匹配,将电子邮件地址与真实姓名关联,或将电话号码与多个在线账户关联。这是身份调查中最具挑战性的方面之一,因为人们在不同平台使用不同的名称、用户名和标识符。现代实体解析使用概率匹配算法,考虑多种信号:精确匹配(相同电子邮件、电话)、模糊匹配(相似名称、部分匹配)、行为信号(写作风格、活动模式)和上下文信号(共享连接、重叠时间线)。
工作原理
实体解析使用多信号匹配流水线。信号 1 — 标识符匹配:电子邮件地址、电话号码和个人资料照片的精确匹配(使用感知哈希)。信号 2 — 姓名相似性:使用 Levenshtein 距离、Jaro-Winkler 相似度和语音算法(Soundex、Metaphone)的模糊字符串匹配,处理拼写变体。信号 3 — 行为匹配:比较写作风格(词汇、句子结构)、发帖模式(时间、频率)和内容兴趣。信号 4 — 网络重叠:检查两个档案是否共享联系人、关注类似账户或属于相同社区。信号 5 — 上下文匹配:比较跨档案的传记细节(位置、雇主、教育)。所有信号在加权评分模型中组合以产生匹配概率。
示例
解析 Twitter 上的"@johndoe"、新闻稿中的"john.doe@company.com"、学术论文中的"John Doe, PhD"和 GitHub 上的"jdoe82"都指向同一个人。系统识别出:Twitter 简介和新闻稿之间的精确电子邮件匹配(信号 1)、Twitter 用户名和学术论文作者之间的姓名相似度 0.92(信号 2)、GitHub 评论和 Twitter 帖子之间的写作风格匹配(信号 3)、LinkedIn 和 Twitter 档案之间的 15 个共同联系人(信号 4)、以及所有档案之间一致的位置和雇主数据(信号 5)。综合匹配概率:97.3%。
应用场景
- •从分散的在线存在构建统一身份档案
- •关联多个欺诈账户的反欺诈检测
- •跨系统连接客户记录的 KYC 合规
- •将匿名来源与真实身份关联的调查性新闻
关键数据
| 指标 | 数值 | 来源 |
|---|---|---|
| 匹配信号 | 5 categories | Seme methodology |
| 匹配置信度阈值 | ≥85% | Seme configuration |
| 平均发现别名数 | 3-10 per subject | Seme analytics |
| 跨平台准确率 | 94%+ | Internal benchmarks |