语言模型如何包容地感知社会与道德规范?
计算与语言
2025-04-17 v2
摘要
本文讨论并包含冒犯性内容。语言模型(LMs)被用于决策系统和交互式助手。然而,这些模型做出的判断与人类价值观的多样性,特别是在社会和道德规范方面,有多大程度的一致性?在这项工作中,我们研究了语言模型如何包容地感知不同人口群体(例如,性别、年龄和收入)的规范。我们向11个语言模型提示经验法则(RoTs),并将其输出与100名人类标注者的现有回答进行比较。我们引入了绝对距离对齐度量(ADA-Met)来量化有序问题上的对齐程度。我们发现语言模型的回答存在显著差异,较年轻、较高收入群体显示出更紧密的对齐,这引发了对边缘化视角代表性的担忧。我们的发现强调了进一步努力使语言模型更包容多样化人类价值观的重要性。代码和提示可在GitHub上获取,遵循CC BY-NC 4.0许可。
引用
@article{arxiv.2502.02696,
title = {How Inclusively do LMs Perceive Social and Moral Norms?},
author = {Michael Galarnyk and Agam Shah and Dipanwita Guhathakurta and Poojitha Nandigam and Sudheer Chava},
journal= {arXiv preprint arXiv:2502.02696},
year = {2025}
}
备注
Accepted at NAACL 2025 Findings