中文

MFTCXplain:基于多跳偏见言论解释评估大语言模型道德推理的多语言基准数据集

计算与语言 2025-10-14 v4

摘要

作为大语言模型(LLMs)被用于社会敏感任务的背景,确保其道德推理能力正日益受到关注。然而,当前的评估基准存在两个主要不足:缺乏为道德分类提供论证说明的标注,这限制了透明度和可解释性;以及主要聚焦于英语,这限制了在多元文化背景下评估道德推理的能力。本文介绍 MFTCXplain,一个基于道德基础理论(Moral Foundations Theory)的、用于通过多跳偏见言论解释评估大语言模型道德推理的多语言基准数据集。MFTCXplain 包含 3000 条跨中文、意大利语、波斯语和英语的推文,标注为二元偏见言论标签、道德类别以及文本片段级别的理由。我们的结果显示,LLM 输出与人类标注在道德推理任务中存在偏差。尽管 LLMs 在偏见言论检测方面表现良好(F1 最高可达 0.836),但其预测道德情感的能力显著薄弱(F1 < 0.35)。此外,理由对齐主要限于较不被代表的语言。我们的发现表明,当前 LLMs 的能力有限,难以内化和反映人类的道德推理。

关键词

引用

@article{arxiv.2506.19073,
  title  = {MFTCXplain: A Multilingual Benchmark Dataset for Evaluating the Moral Reasoning of LLMs through Multi-hop Hate Speech Explanation},
  author = {Jackson Trager and Francielle Vargas and Diego Alves and Matteo Guida and Mikel K. Ngueajio and Ameeta Agrawal and Yalda Daryani and Farzan Karimi-Malekabadi and Flor Miriam Plaza-del-Arco},
  journal= {arXiv preprint arXiv:2506.19073},
  year   = {2025}
}

备注

Jackson Trager and Francielle Vargas contributed equally