LeWiDi-2025 at NLPerspectives:学习与不一致共享任务的第三版本
计算与语言
2026-02-09 v2
摘要
许多研究者已得出结论,AI 模型应被训练以识别人类判断中可能的变异与不一致,并据此进行评估。为此目的,LEWIDI 系列不一致学习共享任务应运而生,通过提供合适的数据集并发展评估方法来推动这一训练与评估方法。第三版任务在此基础上扩展至四个数据集,涵盖改写识别、讽刺识别、讽刺情感识别和自然语言推理,其中标注方案不仅包含前几版的类别判断,还包含序数判断。另一个新颖之处是,我们采用两种互补的评估范式来评估不一致感知系统:软标签方法中,模型预测判断的总体分布;观察者方法中,模型预测单个注释者的解释。关键在于,我们超越了交叉熵等标准指标,对两种范式进行了新评估指标的测试。该任务吸引了多样化的参与,结果为理解建模变异方法的优势与局限提供了见解。总体而言,这些贡献不仅强化了 LEWIDI 作为框架的作用,还提供了新的资源、基准和发现,支持开发不一致感知技术的发展。
引用
@article{arxiv.2510.08460,
title = {LeWiDi-2025 at NLPerspectives: Third Edition of the Learning with Disagreements Shared Task},
author = {Elisa Leonardelli and Silvia Casola and Siyao Peng and Giulia Rizzi and Valerio Basile and Elisabetta Fersini and Diego Frassinelli and Hyewon Jang and Maja Pavlovic and Barbara Plank and Massimo Poesio},
journal= {arXiv preprint arXiv:2510.08460},
year = {2026}
}
备注
14 pages; LeWiDi-2025 shared task description paper at NLPerspective workshop at EMNLP 2025