探究注意力残差 Transformer 中基于路由的条件校准
计算机视觉与模式识别
2026-05-12 v1 人工智能
摘要
事后校准通常仅作为 logits 或 softmax 置信度的函数进行评估,尽管路由增强架构越来越多地伴随预测提供特定于样本的内部路由轨迹,并将其与校准相关的不确定性声明相配对。我们提出一个基本问题:除了置信度之外,这些轨迹是否为事后校准提供稳定的特定于路由的证据?我们在注意力残差 Transformer (Attention-Residual transformers, Kimi Team, 2026) 中通过一个匹配置信度的诊断套件对此进行研究,该套件根据路由导出的状态对样本进行分层,将子组间隙与箱内路由置换的零假设进行比较,并评估仅在辅助特征上有所不同的匹配事后探针。在我们完成的 AR 运行中,标量路由摘要并未提供路由条件误校准的稳定证据:加权间隙保持较小或对随机种子敏感,并且 30 次箱内置换检验中仅有 1 次在 水平下拒绝了条件零假设(仅在一个种子上;在该单元中跨种子不稳定)。AR-CondCal 是一个基于置信度和路由深度方差的极简 维 Nadaraya--Watson 探针,它处于匹配的仅置信度和预测熵控制的种子方差带内,且未能可靠地改善最差路由三分位 ECE;带宽敏感性检查(Scott 倍数、CV-NLL、global-ECE oracle)未改变这一结果。基于 的全向量 MLP 似乎比线性置信度基线有所改善,但一旦将容量匹配的仅置信度 MLP 作为控制组引入,这种表面上的增益就会消失,并且打乱路由特征也能达到相当的性能。在当前 AR 设置下,表观的路由感知校准增益不应被解读为内部状态校准,除非匹配置信度、带宽、容量和置换控制排除了常见的混淆因素。
引用
@article{arxiv.2605.09850,
title = {Probing Routing-Conditional Calibration in Attention-Residual Transformers},
author = {Wenhao Liang and Lin Yue and Wei Emma Zhang and Miao Xu and Mingyu Guo and Olaf Maennel and Weitong Chen},
journal= {arXiv preprint arXiv:2605.09850},
year = {2026}
}
备注
Under reviewing