中文

第四届多语言指代消解共享任务发现:大语言模型能否取代传统方法?

计算与语言 2025-11-07 v2

摘要

本文概述了第四届指代消解共享任务的概览,该任务作为 CODI-CRAC 2025 工作坊的一部分组织。如同以往的版本一样,参赛者面临挑战,需要开发系统来识别提及并根据身份指代对其进行聚类。今年任务的关键创新是引入了专门的大语言模型 (LLM) 轨道,采用简化的纯文本格式,以更适合 LLM 而非原始 CoNLL-U 表示。该任务还通过三个新增数据集(涵盖两个额外语言)扩展了覆盖范围,使用 CorefUD 版本 1.3——一个包含 22 个数据集、覆盖 17 种语言的多语言集合。总共有九个系统参赛,其中包括四个基于 LLM 的方法(两种微调,两种使用 few-shot 适应)。尽管传统系统仍占据主导,但 LLM 显示出明确的潜力,表明它们可能在未来的版本中挑战已建立的方法。

关键词

引用

@article{arxiv.2509.17796,
  title  = {Findings of the Fourth Shared Task on Multilingual Coreference Resolution: Can LLMs Dethrone Traditional Approaches?},
  author = {Michal Novák and Miloslav Konopík and Anna Nedoluzhko and Martin Popel and Ondřej Pražák and Jakub Sido and Milan Straka and Zdeněk Žabokrtský and Daniel Zeman},
  journal= {arXiv preprint arXiv:2509.17796},
  year   = {2025}
}

备注

Accepted to CODI-CRAC 2025