中文

相信我,我是专家:解码并引导大型语言模型中的权威偏见

计算与语言 2026-05-28 v3 机器学习

摘要

先前的研究表明,语言模型在推理任务上的表现会受到建议、提示和背书的影响。然而,背书来源可信度的影响仍有待探索。我们研究了语言模型是否基于背书提供者的感知专业水平而表现出系统性偏见。在涵盖数学、法律和医学推理的 4 个数据集中,我们使用代表每个领域四个专业水平的人格评估了 11 个模型。我们的结果显示,随着来源专业水平的提高,模型越来越容易受到错误/误导性背书的影响,更高权威的来源不仅会导致准确性下降,还会增加对错误答案的信心。我们还表明,这种权威偏见在模型内部被机制性地编码,并且可以引导模型偏离该偏见,从而即使在专家给出误导性背书时也能提高其性能。

关键词

引用

@article{arxiv.2601.13433,
  title  = {Trust Me, I'm an Expert: Decoding and Steering Authority Bias in Large Language Models},
  author = {Priyanka Mary Mammen and Emil Joswin and Shankar Venkitachalam},
  journal= {arXiv preprint arXiv:2601.13433},
  year   = {2026}
}