中文

结构引导实体消解:面向复杂语言情境的 LLM 精调框架

计算与语言 2026-05-25 v1 机器学习

摘要

跨异构记录匹配 person 姓名是实体消解中的核心挑战,尤其在语言和文化复杂的环境中更为突出。命名惯例的差异、跨脚本的不一致 transliteration,以及频繁的数据录入错误,使得统一用户身份标识困难,这是 Know Your Customer (KYC) 合规的必需要求。虽然大型语言模型在理解自然语言方面表现出色,但往往在此类 domain-specific setting 中面临结构化歧义。本文引入 Structure-Guided Entity Resolution (SGER) 框架,通过 two-phase curriculum 对 LLM 进行 fine-tuning。该模型首先学习 person 姓名的语法和语义结构,然后针对 downstream 任务的二元实体匹配进行优化。我们在最具挑战性的印度身份数据环境中进行评估——该环境是全球最语言多样且数据噪声最大的环境之一。SGER 在 50,000 组真实世界配对的 held-out 集上实现 99.02% 的准确率,F1 为 0.994,超越 GPT-4o few-shot prompting 和 single-stage fine-tuning baseline。该系统已在 Dream11——全球最大的 fantasy sports 平台上部署,服务 2.5 亿用户。我们的结果表明,curriculum-guided 训练在大规模真实世界多语言系统中实现了稳健、高精度的实体消解。

关键词

引用

@article{arxiv.2605.23597,
  title  = {Structure-Guided Entity Resolution: Fine-Tuning LLMs for Robust Name Matching in Complex Linguistic Contexts},
  author = {Shivam Chourasia and Hitesh Kapoor and Nilesh Patil},
  journal= {arXiv preprint arXiv:2605.23597},
  year   = {2026}
}

备注

Accepted to ACL 2026. 8 pages, 1 figure, 2 tables