语言模型反映了谁的情感与道德情感?
计算与语言
2024-06-19 v2 计算机与社会
社会与信息网络
摘要
已知语言模型对某些社会群体的观点表示得比其他群体更好,这可能会影响其性能,尤其是在内容审核和仇恨言论检测等主观任务上。为了探索LM如何表示不同观点,现有研究侧重于立场对齐,即模型在多大程度上模仿不同群体(例如自由派或保守派)的意见和立场。然而,人类交流也包含情感和道德维度。我们定义了情感对齐问题,衡量LM的情感和道德基调在多大程度上代表了不同群体的情感和道德基调。通过将36个LM生成的回复的情感与Twitter消息的情感进行比较,我们观察到LM与两个意识形态群体均存在显著的不对齐。这种不对齐大于美国的党派分歧。即使在将LM引导至特定意识形态观点之后,模型的不对齐和自由派倾向依然存在,这表明LM内部存在系统性偏差。
引用
@article{arxiv.2402.11114,
title = {Whose Emotions and Moral Sentiments Do Language Models Reflect?},
author = {Zihao He and Siyi Guo and Ashwin Rao and Kristina Lerman},
journal= {arXiv preprint arXiv:2402.11114},
year = {2024}
}