中文

大型语言模型是否与人类价值观一致?判读与解释社会偏见

计算与语言 2025-09-18 v1

摘要

大型语言模型(LLMs)在与人类价值观不一致时,尤其是在涉及复杂且敏感社会偏见的情境中,可能导致不可取的后果。以前的研究使用专家设计的或基于代理人的模拟偏见情境揭示了LLMs与人类价值观之间的不一致。然而,是否存在不同类型情境(例如包含消极问题与非消极问题)之间的价值观对齐差异,尚不明确。本研究探讨了LLMs关于社会偏见(HVSB)的价值观对齐情况。通过对12个来自四个模型家族和四个数据集的广泛分析,我们展示,参数规模较大的LLMs并不一定具有更低的误判率和攻击成功率。此外,LLMs对特定类型的情境表现出一定的对齐偏好,来自同一模型家族的LLMs倾向于具有更高的判读一致性。我们还研究了LLMs对HVSB理解能力,方法是分析其对HVSB的解释。我们发现不同LLMs之间不存在HVSB理解的显著差异。我们还发现LLMs倾向于选择自身生成的解释。此外,我们为较小的语言模型赋予解释HVSB的能力。生成结果表明,经微调的较小LLMs生成的解释更具可读性,但模型间的同意性相对较低。

关键词

引用

@article{arxiv.2509.13869,
  title  = {Do LLMs Align Human Values Regarding Social Biases? Judging and Explaining Social Biases with LLMs},
  author = {Yang Liu and Chenhui Chu},
  journal= {arXiv preprint arXiv:2509.13869},
  year   = {2025}
}

备注

38 pages, 31 figures