通过参数知识之眼审视大型语言模型中的负向偏见:一种多维度分析
计算与语言
2025-11-17 v1 人工智能
摘要
负向偏见指的是大型语言模型(LLMs)在二元决策任务(如是否问答)中过度生成负向响应的倾向。以往研究聚焦于检测和解决引发负向偏见的负向注意力头,但影响负向偏见的深层细节因素仍鲜有探索。本文证明,LLMs表现出格式级负向偏见,即提示格式对其响应的影响大于负向响应的语义。为进行负向偏见的细粒度研究,我们引入了构建评估集的管道,该管道系统地将数据集分为三个子集,基于模型的参数知识:正确、错误和不足够的相关知识。通过分析该评估集,我们识别出一种捷径行为,即当模型缺乏足够知识回答是否问题时,倾向于生成负向响应,从而导致负向偏见。我们进一步检查了在 various 提示情景下负向偏见的变化情况,这些情景与参数知识相关。我们观察到,提供相关上下文和提供"我不知道"选项通常会减少负向偏见,而链式思维提示则倾向于放大偏见。最后,我们证明,负向偏见的程度取决于提示的类型,这会影响响应的方向。我们的工作揭示了影响负向偏见的各种因素,为缓解LLMs中的负向偏见提供了关键见解。
引用
@article{arxiv.2511.10881,
title = {A Multifaceted Analysis of Negative Bias in Large Language Models through the Lens of Parametric Knowledge},
author = {Jongyoon Song and Sangwon Yu and Sungroh Yoon},
journal= {arXiv preprint arXiv:2511.10881},
year = {2025}
}
备注
Accepted to IEEE Transactions on Audio, Speech and Language Processing