中文

偏见缓解还是文化常识?基于日本数据集评估LLM

计算与语言 2025-09-30 v1

摘要

大语言模型(LLMs)表现出社会偏见,推动了各种去偏方法的开发。然而,去偏方法可能降低LLM的能力。以往研究主要通过衡量通用语言理解的任务来评估偏见缓解的影响,这些任务常与社会偏见无关。相反,文化常识与社会偏见密切相关,二者都根植于社会规范和价值观。对LLM文化常识影响的去偏方法尚未得到充分考察。在此背景下,我们提出SOBACO(Social Bias and Cultural Commonsense benchmark),一个旨在统一格式评估LLM社会偏见和文化常识的日本基准测试。我们在SOBACO上评估了多个LLM,检验去偏方法如何影响LLM的文化常识。我们的结果显示,去偏方法会导致LLM在文化常识任务上的性能下降(最高可达75%的准确率恶化)。这些结果凸显了发展兼顾文化常识权衡的去偏方法的重要性,以提高LLM的公平性和实用性。

关键词

引用

@article{arxiv.2509.24468,
  title  = {Bias Mitigation or Cultural Commonsense? Evaluating LLMs with a Japanese Dataset},
  author = {Taisei Yamamoto and Ryoma Kumon and Danushka Bollegala and Hitomi Yanaka},
  journal= {arXiv preprint arXiv:2509.24468},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 main