中文

通过虚构人物嵌入提高引号归属识别

计算与语言 2025-01-24 v2

摘要

人类在文学作品中自然地将直接语音的陈述归属给其说话者。归属引号时,我们会处理情境信息,同时访问我们在叙事中构建和修订的人物心理表征。近期方法尝试通过确定性规则或神经网络学习新的隐式规则来模拟人类逻辑进行自动归属,但这些系统本质上缺乏“人物”表征,常导致对更具挑战性的归属案例(指代消失的引号和隐式引号)出现错误。本文提出向流行的引号归属系统 BookNLP 增添人物嵌入,这类嵌入编码了从通用作者表征模型 Universal Authorship Representation (UAR) 中派生的人物全局风格信息。我们创建了 DramaCV (代码和数据可在 https://github.com/deezer/character_embeddings_qa 查找),该平台涵盖 15 至 20 世纪的英语戏剧剧本,自动标注用于虚构人物言语归属验证。我们发布两个针对文学人物分析训练的 UAR 版本。通过对 28 部小说进行大规模评估,我们表明,将 BookNLP 的情境信息与我们提出的全局人物嵌入相结合,可提高对指代消失引号和隐式引号的说话者识别准确度,达到最新成果。

关键词

引用

@article{arxiv.2406.11368,
  title  = {Improving Quotation Attribution with Fictional Character Embeddings},
  author = {Gaspard Michel and Elena V. Epure and Romain Hennequin and Christophe Cerisara},
  journal= {arXiv preprint arXiv:2406.11368},
  year   = {2025}
}

备注

EMNLP 2024 (Findings)