大型语言模型是否与人类价值观一致?判读与解释社会偏见
计算与语言
2025-09-18 v1
摘要
大型语言模型(LLMs)在与人类价值观不一致时,尤其是在涉及复杂且敏感社会偏见的情境中,可能导致不可取的后果。以前的研究使用专家设计的或基于代理人的模拟偏见情境揭示了LLMs与人类价值观之间的不一致。然而,是否存在不同类型情境(例如包含消极问题与非消极问题)之间的价值观对齐差异,尚不明确。本研究探讨了LLMs关于社会偏见(HVSB)的价值观对齐情况。通过对12个来自四个模型家族和四个数据集的广泛分析,我们展示,参数规模较大的LLMs并不一定具有更低的误判率和攻击成功率。此外,LLMs对特定类型的情境表现出一定的对齐偏好,来自同一模型家族的LLMs倾向于具有更高的判读一致性。我们还研究了LLMs对HVSB理解能力,方法是分析其对HVSB的解释。我们发现不同LLMs之间不存在HVSB理解的显著差异。我们还发现LLMs倾向于选择自身生成的解释。此外,我们为较小的语言模型赋予解释HVSB的能力。生成结果表明,经微调的较小LLMs生成的解释更具可读性,但模型间的同意性相对较低。
引用
@article{arxiv.2509.13869,
title = {Do LLMs Align Human Values Regarding Social Biases? Judging and Explaining Social Biases with LLMs},
author = {Yang Liu and Chenhui Chu},
journal= {arXiv preprint arXiv:2509.13869},
year = {2025}
}
备注
38 pages, 31 figures