中文

文学作品全篇法语小说中的核心指代解析

计算与语言 2025-10-20 v1

摘要

尽管核心指代解析在计算语言学研究中受到越来越多的关注,但代表性的、完整标注的长文档数据集仍然匮乏。本文介绍了一个由三部完整法语小说构成的新标注语料库,总计超过 28 万 token。与专注于短文本的先前数据集不同,我们的语料库解决了长复杂文学作品所面临的挑战,使我们能够在长指代链的上下文中评估核心指代模型。我们提出了模块化的核心指代解析管道,允许进行细粒度的错误分析。我们展示了我们的做法在处理长文档方面具有竞争力且有效扩展。最后,我们演示了其用于推断虚构人物性别的用途,展示了其对文学分析及下游 NLP 任务的相关性。

关键词

引用

@article{arxiv.2510.15594,
  title  = {The Elephant in the Coreference Room: Resolving Coreference in Full-Length French Fiction Works},
  author = {Antoine Bourgois and Thierry Poibeau},
  journal= {arXiv preprint arXiv:2510.15594},
  year   = {2025}
}