中文

Histoires Morales:法语道德对齐评估数据集

计算与语言 2025-01-29 v1 人工智能

摘要

随着大型语言模型在日常生活中日益普及,对齐语言模型以符合人类价值观至关重要。虽然模型常被适应以符合用户偏好,但确保其在真实社交情境中符合道德规范与行为同样重要。尽管英语和中文等语言在此方面取得了显著进展,但法语仅有少量关注,导致我们难以了解大型语言模型在该语言下处理道德推理的能力。为填补这一空白,我们引入 Histoires Morales,这是一个源自 Moral Stories 的法语数据集,经由翻译后由母语者协助润色,以保证语法准确性并适配法语文化语境。我们还对数据集中的道德价值进行标注,以确保其符合法国规范。Histoires Morales 涵盖广泛的社交情境,包括小费实践差异、关系中的诚实表达以及对动物的责任等。为促进未来研究,我们还对多语言模型在法语和英语数据上的对齐情况及其鲁棒性进行了初步实验。我们发现,尽管大型语言模型默认情况下已与人类道德规范 generally 对齐,但在接受用户偏好优化后,对于道德和不道德的数据都容易受到影响。

关键词

引用

@article{arxiv.2501.17117,
  title  = {Histoires Morales: A French Dataset for Assessing Moral Alignment},
  author = {Thibaud Leteno and Irina Proskurina and Antoine Gourru and Julien Velcin and Charlotte Laclau and Guillaume Metzler and Christophe Gravier},
  journal= {arXiv preprint arXiv:2501.17117},
  year   = {2025}
}

备注

Accepted to NAACL 2025