中文

结合人类标注差异的细粒度谬误检测

计算与语言 2025-02-20 v1

摘要

我们引入了 Faina,首个包容多个合理答案与自然分歧的谬误检测数据集。Faina 包含两位专家标注者对意大利语社交媒体帖文(关于移民、气候变化和公共健康)给出的逾 11K 个跨 20 种谬误类型的跨度级重叠标注。通过一项允许多轮讨论的广泛标注研究,我们在保留人类标注差异信号的同时最小化了标注误差。此外,我们设计了一个超越“单一真值”评估的框架,同时兼顾多个(同等可靠的)测试集及任务的特性,即部分跨度匹配、重叠和标注误差的不同严重程度。我们在四种谬误检测设置下的实验表明,基于 Transformer 的多任务和多标签方法是所有设置中的强基线。我们发布数据、代码和标注指南,以促进更广泛的谬误检测与人类标注差异研究。

关键词

引用

@article{arxiv.2502.13853,
  title  = {Fine-grained Fallacy Detection with Human Label Variation},
  author = {Alan Ramponi and Agnese Daffara and Sara Tonelli},
  journal= {arXiv preprint arXiv:2502.13853},
  year   = {2025}
}

备注

NAACL 2025