大型语言模型中的偏好头部:可解释个性化的机制框架
计算与语言
2026-04-27 v1
摘要
大型语言模型(LLMs)表现出强大的隐式个性化能力,但大多数现有方法将其视为黑盒,依赖于提示工程或针对用户数据进行微调。在本工作中,我们采用机制可解释性视角,假设存在一组稀疏的偏好头部(Preference Heads),即编码用户特定风格和主题偏好的注意力头,并对生成产生因果影响。在我们引入的差分偏好引导(DPS)框架中,(1) 通过因果掩码分析识别偏好头部,(2) 在推理时利用它们实现可控且可解释的个性化。DPS 计算每个注意力头的偏好贡献得分(PCS),直接衡量其对用户对齐输出的因果影响。在解码时,我们与和而不同地模型预测,放大了个性化 logits 与通用 logits 之间的差异,以有选择地强化与偏好一致的继续。实验在多个 LLMs 上进行,涵盖广泛使用的个性化基准测试,显示在保持内容连贯性和低计算开销的同时,个性化忠诚度 consistently 提升。除了实证改进之外,DPS 提供了关于个性化在 transformer 架构中何处以及如何出现的机制解释。我们的实现已公开。
引用
@article{arxiv.2604.22345,
title = {Preference Heads in Large Language Models: A Mechanistic Framework for Interpretable Personalization},
author = {Weixu Zhang and Ye Yuan and Changjiang Han and Yuxing Tian and Zipeng Sun and Linfeng Du and Jikun Kang and Hong Kang and Xue Liu and Haolun Wu},
journal= {arXiv preprint arXiv:2604.22345},
year = {2026}
}
备注
Accepted at ACL 2026