MAFALDA:谬误检测与分类的基准及综合研究
计算与语言
2024-04-11 v2 人工智能
机器学习
摘要
我们提出 MAFALDA,一个融合并统一先前谬误数据集的谬误分类基准。它附带一套对齐、精炼并统一现有谬误分类体系的分类型框架。我们进一步提供了该数据集部分内容的手动标注,以及针对每项标注的人工解释。我们提出了一种为主观 NLP 任务量身定制的新标注方案,以及一种旨在处理主观性的新评估方法。随后,我们在零样本学习设定下评估若干语言模型及人类在 MAFALDA 上的表现,以衡量其检测与分类谬误的能力。
引用
@article{arxiv.2311.09761,
title = {MAFALDA: A Benchmark and Comprehensive Study of Fallacy Detection and Classification},
author = {Chadi Helwe and Tom Calamai and Pierre-Henri Paris and Chloé Clavel and Fabian Suchanek},
journal= {arXiv preprint arXiv:2311.09761},
year = {2024}
}