中文

Faithful-Patchscopes:理解和缓解大语言模型隐藏表征解释中的模型偏置

计算与语言 2026-02-03 v1

摘要

大语言模型(LLMs)通过Patchscopes框架展示了强大的隐藏表征解释能力,该框架使用LLMs本身来生成人类可读的解释,通过解码内部隐藏表征来实现。然而,我们的工作表明,LLMs倾向于依赖固有的语言模式,这可能会在解码时覆盖隐藏表征中编码的上下文信息。例如,即使隐藏表征为"broccoli"编码了上下文属性"purple",LLMs仍会生成"green"的解释,反映出强烈的先验关联。这一行为揭示了Patchscopes存在系统性的不忠实问题。为系统性地研究此问题,我们首先设计了一个评估Patchscopes在有偏置情况下的忠诚度的数据集,我们的结果表明,在有偏置情况下,忠诚度平均下降了18.84%。随后,我们提出了通过Logit Recalibration实现偏置对齐(Bias Alignment through Logit Recalibration, BALOR),该方法将未修补提示下的输出logit视为模型偏置,并与在修补上下文信息后获取的logit进行对比。通过这种对比进行logit分布的重校准,BALOR抑制了模型偏置,放大了上下文信息的生成。跨多个LLMs的实验表明,BALOR consistently优于现有基线方法,实现了最高33%的相对性能提升。

关键词

引用

@article{arxiv.2602.00300,
  title  = {Faithful-Patchscopes: Understanding and Mitigating Model Bias in Hidden Representations Explanation of Large Language Models},
  author = {Xilin Gong and Shu Yang and Zehua Cao and Lynne Billard and Di Wang},
  journal= {arXiv preprint arXiv:2602.00300},
  year   = {2026}
}