UAT-LITE:面向预训练Transformer的推理时不确定性感知注意力
人工智能
2026-03-11 v2
摘要
神经NLP模型常常校准不良且过于自信,对错误预测赋予高置信度,并且在内部证据聚合过程中未能表达不确定性。这损害了选择性预测和高风险部署。事后校准方法调整输出概率,但内部计算保持不变,而集成和贝叶斯方法以显著的训练或存储成本改善了不确定性。我们提出了UAT-LITE,一个推理时框架,通过在预训练Transformer分类器中应用蒙特卡洛dropout,使自注意力具有不确定性感知能力。与输出级校准(例如TS)不同,UAT-LITE将认知不确定性直接注入注意力,从而在上下文化过程中实现不确定性感知路由,并提供超越全局logit重新缩放的令牌级诊断信号。令牌级认知不确定性通过随机前向传播估计,并用于在上下文化过程中调节自注意力,而无需修改预训练权重或训练目标。我们还引入了一种逐层方差分解方法,以诊断预测不确定性如何在Transformer深度上累积。在SQuAD 2.0可回答性、MNLI和SST-2上,与微调后的BERT-base基线相比,UAT-LITE在保持准确率的同时,平均相对ECE降低了约20%,并在分布偏移下为选择性预测提供了更具信息量的不确定性行为。
引用
@article{arxiv.2602.02952,
title = {UAT-LITE: Inference-Time Uncertainty-Aware Attention for Pretrained Transformers},
author = {Elias Hossain and Shubhashis Roy Dipta and Subash Neupane and Rajib Rana and Ravid Shwartz-Ziv and Ivan Garibay and Niloofar Yousefi},
journal= {arXiv preprint arXiv:2602.02952},
year = {2026}
}