对齐税:对齐型大语言模型中的响应均质化及其不确定性估计影响
摘要
RLHF 对齐的语言模型表现出响应均质化现象:在TruthfulQA(n=790)上,40-79%的问题会产生单一语义簇,跨10个独立抽样样本。对于受影响的问题,基于抽样的方法在不确定性估计中几乎无判别力(AUROC=0.500),而自由 token 熵仍保留信号(0.603)。这种对齐税是 task-dependent 的:在GSM8K(n=500)上,token 熵实现0.724(Cohen's d=0.81)。base-vs-instruct 的消除实验确认了对齐的因果作用:base模型仅有1.0%的单一簇率,而instruct模型为28.5%(p < 10^{-6})。训练阶段消除实验(Base 0.0% -> SFT 1.5% -> DPO 4.0% SCR)将原因定位到DPO,而非SFT。跨家族复制实验在四个模型家族中揭示,对齐税的严重程度因家族和规模而异。我们在22项实验、5个基准、4个模型家族和3个模型规模(3B-14B)上进行了验证,Jaccard、embedding 和 NLI 基线在三个 DeBERTa 规模上均约为0.51 AUROC。跨 embedder 验证使用两个独立的 embedding 家族排除了耦合偏置。跨数据集验证在WebQuestions(58.0% SCR)上确认了超越TruthfulQA的泛化性。核心发现——响应均质化——是 implementation-independent 的且无标签的。以此诊断为动机,我们探索了一种基于正交不确定性信号的性价比最高级联(UCBD)。选择性预测将GSM8K准确率从84.4%提升至93.2%,覆盖率为50%;弱相关边界(|r| <= 0.12)实现57%的成本节省。
引用
@article{arxiv.2603.24124,
title = {The Alignment Tax: Response Homogenization in Aligned LLMs and Its Implications for Uncertainty Estimation},
author = {Mingyi Liu},
journal= {arXiv preprint arXiv:2603.24124},
year = {2026}
}
备注
25 pages, 3 figures, 10 tables, 24 experiments across 5 benchmarks. v2: added SINdex head-to-head (Exp 27), NLI validation (Exp 28), decoding protocol analysis. Code: https://github.com/DigitLion/ucbd-experiment