中文

BengaliMoralBench:面向孟加拉语言与文化的大型语言模型道德推理基准

计算与语言 2026-04-21 v2

摘要

随着多语言大型语言模型(LLM)在南亚地区的流行,其与本土伦理规范的一致性尤其是针对孟加拉语(全球约有2.85亿人使用,全球使用人数最多的语言之一)的对齐,仍未得到充分探索。现有的伦理基准主要以英语为中心,受制于西方道德框架,忽视了至关重要的文化细微差别,难以在实际部署中发挥作用。为填补这一空白,我们引入 BengaliMoralBench,这是一个为孟加拉语和社会文化语境设计的大规模伦理基准。我们的基准涵盖五个道德领域:(1)日常活动,(2)习惯,(3)育儿,(4)家庭关系,和(5)宗教活动,每个子领域细分为十个具有文化内涵的类别,共计 50 个子主题。每个情景都通过本土语言使用者的共识在三个伦理视角下进行标注:德性伦理、常识伦理和正义伦理。我们在统一的提示协议下,对开源和闭源模型进行系统的零样本评估,包括最新的 Llama 和 Gemma 变体、Qwen 和 DeepSeek 模型, frontier 模型(GPT-4o-mini 和 Gemini 1.5 Pro),以及一个大型多语言基线(Qwen3-Next-80B)。结果显示在不同视角和子领域中的表现存在显著差异,我们的定性分析揭示了在文化定位、常识推理和道德公平性方面存在持久的弱点。这些发现暴露了当前 LLM 在非西方环境中的关键局限,凸显了需要文化嵌入的评估的重要性。BengaliMoralBench 为负责任地本地化和基准测试提供了基础,支持在文化多样化、资源匮乏的市场(如孟加拉国)中部署语言技术。

关键词

引用

@article{arxiv.2511.03180,
  title  = {BengaliMoralBench: A Benchmark for Auditing Moral Reasoning in Large Language Models within Bengali Language and Culture},
  author = {Shahriyar Zaman Ridoy and Azmine Toushik Wasi and Koushik Ahamed Tonmoy and Taki Hasan Rafi and Dong-Kyu Chae},
  journal= {arXiv preprint arXiv:2511.03180},
  year   = {2026}
}

备注

Accepted at ACM FAccT 2026