中文

大型语言模型的道德判断与推理能力是否随语言而变化?一项基于多语言定义问题测试的研究

计算与语言 2024-02-06 v1 人工智能

摘要

本文通过定义问题测试(Defining Issues Test)探讨了大型语言模型(LLMs)在不同语言中表现出的道德判断和道德推理能力。众所周知,道德判断取决于提问所使用的语言。我们将相关工作从英语扩展到 5 种新语言(中文、印地语、俄语、西班牙语和斯瓦希里语),并探究了三种 LLMs——ChatGPT、GPT-4 和 Llama2Chat-70B,它们展现出强大的多语言文本处理和生成能力。我们的研究表明,所有模型的道德推理能力(以后习俗得分表示)在印地语和斯瓦希里语中明显低于西班牙语、俄语、中文和英语,而后四种语言的表现没有明显趋势。道德判断也因语言的不同而有显著差异。

关键词

引用

@article{arxiv.2402.02135,
  title  = {Do Moral Judgment and Reasoning Capability of LLMs Change with Language? A Study using the Multilingual Defining Issues Test},
  author = {Aditi Khandelwal and Utkarsh Agarwal and Kumar Tanmay and Monojit Choudhury},
  journal= {arXiv preprint arXiv:2402.02135},
  year   = {2024}
}

备注

Accepted to EACL 2024 (main)