中文

论语言模型中的实体识别

计算与语言 2025-07-22 v4

摘要

我们分析了语言模型(LM)的内部表示在多大程度上能够识别并区分命名实体的提及,重点关注实体与其提及之间的多对多对应关系。我们首先阐述了实体提及的两个问题——歧义性和变异性,并提出了一个类似于聚类质量指标的框架。具体而言,我们通过对 LM 内部表示的聚类分析,量化了同一实体的提及聚集在一起的程度,以及不同实体的提及保持分离的程度。我们的实验考察了五个基于 Transformer 的自回归模型,结果表明它们能够有效地识别和区分实体,其类似于精确率和召回率的指标范围在 0.66 到 0.9 之间。进一步分析表明,与实体相关的信息在早期 LM 层的低维线性子空间中被紧凑地表示。此外,我们阐明了实体表示的特征如何影响词预测性能。这些发现通过 LM 表示与现实世界中以实体为中心的知识结构之间的同构视角进行了解释,为 LM 如何内部组织和使用实体信息提供了深刻见解。

关键词

引用

@article{arxiv.2506.02701,
  title  = {On Entity Identification in Language Models},
  author = {Masaki Sakata and Benjamin Heinzerling and Sho Yokoi and Takumi Ito and Kentaro Inui},
  journal= {arXiv preprint arXiv:2506.02701},
  year   = {2025}
}

备注

ACL 2025 Findings; 26 pages, 13 figures, 9 tables