中文

论语言模型中真实性与政治偏置的关系

计算与语言 2024-12-02 v2 人工智能

摘要

语言模型对齐研究通常试图确保模型不仅有用且无害,而且真实且无偏。然而,同时优化这些目标可能会掩盖改进一个方面如何影响其他方面。在这项工作中,我们专注于分析在语言模型对齐和政治学中都至关重要的两个概念之间的关系:真实性和政治偏置。我们在各种流行的真实性数据集上训练奖励模型,随后评估其政治偏置。我们的研究结果表明,在这些数据集上针对真实性优化奖励模型往往会导致左倾的政治偏置。我们还发现,现有的开源奖励模型(即那些在标准人类偏好数据集上训练的模型)已经表现出类似的偏置,并且模型越大偏置越大。这些结果提出了关于用于表示真实性的数据集、将模型对齐为既真实又政治无偏的潜在局限性,以及语言模型捕捉到的关于真实与政治之间关系的什么内容等重要问题。

关键词

引用

@article{arxiv.2409.05283,
  title  = {On the Relationship between Truth and Political Bias in Language Models},
  author = {Suyash Fulay and William Brannon and Shrestha Mohanty and Cassandra Overney and Elinor Poole-Dayan and Deb Roy and Jad Kabbara},
  journal= {arXiv preprint arXiv:2409.05283},
  year   = {2024}
}

备注

EMNLP 2024