中文

评估大语言模型的道德价值多元性

计算与语言 2023-12-19 v1 人工智能

摘要

人工智能领域目前缺乏定量评估和潜在改变大语言模型(LLM)输出中固有道德价值的方法。然而,数十年的社会科学研究已经开发并完善了广泛接受的道德价值调查,例如世界价值观调查(WVS),通过直接询问不同地区的问题来引发价值判断。我们将这些问题转化为价值陈述,并使用自然语言处理(NLP)来计算流行的LLM与不同人口统计和文化背景的道德价值的一致程度。虽然WVS被接受为对价值观的显式评估,但我们缺乏评估媒体中隐含的道德和文化价值观的方法,例如在社交媒体、政治言论、叙事中遇到的,以及由日益出现在我们日常生活中的AI系统(如LLM)生成的价值观。当我们消费在线内容并利用LLM输出时,我们可能会问,哪些道德价值观被隐含地推广或削弱,或者——就LLM而言——如果它们意图代表一种文化身份,它们是否一致地这样做?在本文中,我们利用一种识别价值共鸣(RVR)的NLP模型来识别与给定输出文本段落共鸣和冲突的WVS价值观。我们将RVR应用于LLM生成的文本,以表征隐含的道德价值观,从而量化LLM与使用WVS调查的各种人口统计群体之间的道德/文化距离。与其他研究一致,我们发现LLM表现出几种以西方为中心的价值观偏见;它们高估了非西方国家人民的保守程度,在代表非西方国家的性别方面不太准确,并将老年人口描绘为具有更传统的价值观。我们的结果突出了价值观错位和年龄组,以及需要社会科学知识支持的技术解决方案来解决LLM中的价值多元性。

关键词

引用

@article{arxiv.2312.10075,
  title  = {Assessing LLMs for Moral Value Pluralism},
  author = {Noam Benkler and Drisana Mosaphir and Scott Friedman and Andrew Smart and Sonja Schmer-Galunder},
  journal= {arXiv preprint arXiv:2312.10075},
  year   = {2023}
}

备注

Accepted Paper to workshop on "AI meets Moral Philosophy and Moral Psychology: An Interdisciplinary Dialogue about Computational Ethics" at NeurIPS 2023