中文

词汇和上下文指代消解系统在提及噪声下的性能退化差异:基于科学软件提及的实证研究

计算与语言 2026-04-03 v1 机器学习

摘要

我们参与了 SOMD 2026 数据集上的跨文档软件提及指代消解共享任务,系统在所有三个子任务中均排名第二。我们比较了两种无需微调的方案:模糊匹配(Fuzzy Matching, FM),一种基于词汇字符串相似度的方法;以及上下文感知表示(Context Aware Representations, CAR),它结合了提及级别和文档级别的嵌入。两种方法在所有子任务中均取得竞争性能(CoNLL F1 为 0.94-0.96),其中 CAR 在官方测试集上始终优于 FM 约 1 分,这与软件名称高度表面规则性有关,降低了复杂语义推理的需求。我们进行的受控噪声注入研究揭示了互补的失效模式:随着边界噪声增加,CAR 从干净输入到完全损坏输入仅损失 0.07 分的 F1 分数,而 FM 损失 0.20 分;在提及替换情境下,FM 的退化更平滑(0.52 vs 0.63)。我们的推理时间分析表明,FM 随语料库规模的扩展呈超线性增长,而 CAR 约为线性扩展,因而在大规模场景下更高效。这些发现表明,系统选择应受上游提及检测器的噪声轮廓以及目标语料库规模的双重影响。我们发布了代码,以支持该领域尚未充分探索的任务的后续工作。

关键词

引用

@article{arxiv.2604.02171,
  title  = {Do Lexical and Contextual Coreference Resolution Systems Degrade Differently under Mention Noise? An Empirical Study on Scientific Software Mentions},
  author = {Atilla Kaan Alkan and Felix Grezes and Jennifer Lynn Bartlett and Anna Kelbert and Kelly Lockhart and Alberto Accomazzi},
  journal= {arXiv preprint arXiv:2604.02171},
  year   = {2026}
}

备注

8 pages