结合人类标注差异的细粒度谬误检测
计算与语言
2025-02-20 v1
摘要
我们引入了 Faina,首个包容多个合理答案与自然分歧的谬误检测数据集。Faina 包含两位专家标注者对意大利语社交媒体帖文(关于移民、气候变化和公共健康)给出的逾 11K 个跨 20 种谬误类型的跨度级重叠标注。通过一项允许多轮讨论的广泛标注研究,我们在保留人类标注差异信号的同时最小化了标注误差。此外,我们设计了一个超越“单一真值”评估的框架,同时兼顾多个(同等可靠的)测试集及任务的特性,即部分跨度匹配、重叠和标注误差的不同严重程度。我们在四种谬误检测设置下的实验表明,基于 Transformer 的多任务和多标签方法是所有设置中的强基线。我们发布数据、代码和标注指南,以促进更广泛的谬误检测与人类标注差异研究。
关键词
引用
@article{arxiv.2502.13853,
title = {Fine-grained Fallacy Detection with Human Label Variation},
author = {Alan Ramponi and Agnese Daffara and Sara Tonelli},
journal= {arXiv preprint arXiv:2502.13853},
year = {2025}
}
备注
NAACL 2025