矛盾仲裁者:在无共识任务中使用 LLM 的挑战
计算与语言
2025-06-02 v1
摘要
越来越多地将 LLM 作为人类的替代品来“对齐”LLM 的做法,引发了关于它们复制人类判断和偏好能力的质疑,特别是在人类存在分歧的矛盾场景中。本研究考察了 LLM 在三种角色中的偏差和局限性:答案生成者、评判者和辩论者。这些角色松散地对应于先前描述的对齐框架:偏好对齐(评判者)和可扩展监督(辩论者),而答案生成者反映了用户交互的典型设置。我们通过策划涵盖各种先验矛盾场景的示例开发了一个“无共识”基准,每个示例都呈现两种可能的立场。我们的结果表明,尽管 LLM 在生成开放式答案时能够提供细致的评估,但当它们被用作评判者或辩论者时,往往会在无共识的话题上采取特定立场。这些发现强调了需要更复杂的方法在没有人类监督的情况下对齐 LLM,并突显了即使在人类自身存在分歧的话题上,LLM 也无法完全捕捉人类的分歧。
引用
@article{arxiv.2505.23820,
title = {Arbiters of Ambivalence: Challenges of Using LLMs in No-Consensus Tasks},
author = {Bhaktipriya Radharapu and Manon Revel and Megan Ung and Sebastian Ruder and Adina Williams},
journal= {arXiv preprint arXiv:2505.23820},
year = {2025}
}