CORAL:正确性优化残差激活镜头
机器学习
2026-02-06 v1 人工智能
摘要
大型语言模型(LLMs)在指令调谋和偏好对齐后仍表现出持久的校准问题。修改训练目标可改善校准,但 retraining代价高昂。推理时引导提供了轻量级替代方案,但大多数现有方法优化的是正确性的代理,而非正确性本身。我们引入CORAL(Correctness-Optimized Residual Activation Lens),这是一种正则化的推理时引导方法,通过权重衰减MLP探针捕获分布式正确性信号。我们在三个7B参数模型上评估CORAL,发现其在GSM8K等任务上平均以10%的准确率提升和50%的预期校准误差(ECE)改善。我们 additionally 演示,这些收益无需重新训练即可转移到四个 held-out基准测试的完整发布测试集上(ARC-Challenge、HellaSwag、Math-MC、OpenBookQA),平均实现14%的准确率提升和49%的ECE改善。我们的结果支持分布式信息可在模型内部通过正则化探针提取的假设,即单个神经元不足时,这种情况成立。CORAL因此提供了一种计算高效、可转移且具校准 awareness的方法,在推理期间提高MCQA性能。
引用
@article{arxiv.2602.06022,
title = {Correctness-Optimized Residual Activation Lens (CORAL): Transferrable and Calibration-Aware Inference-Time Steering},
author = {Miranda Muqing Miao and Young-Min Cho and Lyle Ungar},
journal= {arXiv preprint arXiv:2602.06022},
year = {2026}
}