中文

多语言语言模型是否捕捉了不同的道德规范?

计算与语言 2022-03-21 v1

摘要

大规模多语言句子表示在大量未经筛选的数据语料上训练,且训练所包含语言的占比极不均衡。这可能导致模型从高资源语言中获取包括道德判断在内的文化价值观,并将其强加于低资源语言。某些语言数据的缺失也可能导致模型形成随机且因而潜在有害的信念。这两个问题都会对零样本跨语言模型迁移产生负面影响,并可能引发有害后果。因此,我们的目标是:(1)通过比较不同语言下的不同模型来检测并量化这些问题;(2)开发改进模型不良属性的方法。我们使用多语言模型 XLM-R 的初步实验表明,多语言 LM 确实捕捉了道德规范,甚至可能在与人类判断的一致性上高于单语模型。然而,这些道德规范在不同语言间的差异程度尚不清楚。

关键词

引用

@article{arxiv.2203.09904,
  title  = {Do Multilingual Language Models Capture Differing Moral Norms?},
  author = {Katharina Hämmerl and Björn Deiseroth and Patrick Schramowski and Jindřich Libovický and Alexander Fraser and Kristian Kersting},
  journal= {arXiv preprint arXiv:2203.09904},
  year   = {2022}
}