中文

测量大型语言模型的精神价值观与偏见

计算与语言 2025-07-17 v2

摘要

大型语言模型(LLMs)已成为来自不同背景用户不可或缺的工具。LLMs在庞大的语料库上训练,反映了其预训练数据中嵌入的语言和文化细微差别。然而,这些数据中固有的价值观和观点可能会影响LLMs的行为,导致潜在的偏见。因此,在涉及精神或道德价值观的背景下使用LLMs需要仔细考虑这些潜在的偏见。我们的工作首先通过测试流行LLMs的精神价值观来验证我们的假设。实验结果表明,LLMs的精神价值观相当多样化,与无神论者或世俗主义者的刻板印象相反。然后,我们研究了不同的精神价值观如何影响LLMs在社会公平场景(例如仇恨言论识别)中的表现。我们的发现揭示,不同的精神价值观确实导致对不同仇恨目标群体的不同敏感性。此外,我们提出在精神文本上继续预训练LLMs,实证结果证明了这种方法在减轻精神偏见方面的有效性。

关键词

引用

@article{arxiv.2410.11647,
  title  = {Measuring Spiritual Values and Bias of Large Language Models},
  author = {Songyuan Liu and Ziyang Zhang and Runze Yan and Wei Wu and Carl Yang and Jiaying Lu},
  journal= {arXiv preprint arXiv:2410.11647},
  year   = {2025}
}

备注

9 pages including appendix; 5 figures; 5 tables