中文

词丰富的跨文档指代注释:一种新方法

计算与语言 2026-03-09 v2

摘要

跨文档指代解析(CDCR)识别并链接相关文档中指代同一实体和事件的mention,从而实现以话语参与者为水平聚合信息的分析。然而,现有数据集主要聚焦于事件指代解析,采用狭窄的指代定义,限制了其在措辞差异大、呈现多元化新闻报道的情境下的有效性。本文提出一种修订版的 CDCR 注释方案,用于 NewsWCL50 数据集,将指代链视为话语元素(DE)及分析概念单位。该方法容纳身份指代和近身份指代关系,例如通过链接“头等车”——“难民”——“正在考虑非法入境者”等表述,使模型能够捕捉词汇多样性和话语框架变化,同时保持 DE 的细粒度注释。我们使用统一的注释手册重新注释 NewsWCL50 和 ECB+ 的子集,并通过词汇多样性指标和 same-head-lemma 基线评估新数据集。结果表明,重新注释后的数据集在一致性方面接近原 ECB+ 和 NewsWCL50,从而支持在新闻领域进行平衡且话语感知的 CDCR 研究。

关键词

引用

@article{arxiv.2602.17424,
  title  = {Diverse Word Choices, Same Reference: Annotating Lexically-Rich Cross-Document Coreference},
  author = {Anastasia Zhukova and Felix Hamborg and Karsten Donnay and Norman Meuschke and Bela Gipp},
  journal= {arXiv preprint arXiv:2602.17424},
  year   = {2026}
}

备注

accepted to ACDSA 2026