中文

在野自适应:基于锐度与特征正则化的测试时熵最小化

机器学习 2025-09-08 v1

摘要

当测试数据存在以下情况时,测试时自适应(TTA)可能无法提升甚至损害模型性能:1)混合分布偏移,2)小批量大小,3)在线不平衡标签分布偏移。这通常是阻碍现有TTA方法部署到现实世界的关键障碍。本文中,我们探究了导致不稳定的原因,发现批归一化层是阻碍TTA稳定性的关键因素。相反,使用与批次无关的归一化层(即组归一化或层归一化)时,TTA可以表现得更稳定。然而,我们观察到,采用组归一化和层归一化的TTA并非总能成功,仍会遇到许多失败案例,即模型崩溃为平凡解,为所有样本分配相同的类别标签。通过深入探究,我们发现在崩溃过程中:1)模型梯度通常经历初始爆炸后迅速衰减,表明某些具有大梯度的噪声测试样本可能干扰了自适应过程;2)模型表征倾向于表现出高相关性和分类偏差。为解决此问题,我们首先提出了一种锐度感知且可靠的熵最小化方法,称为SAR,从两方面稳定TTA:1)移除部分具有大梯度的噪声样本,2)鼓励模型权重到达平坦最小值,使模型对剩余噪声样本具有鲁棒性。基于SAR,我们进一步引入SAR^2,通过两个正则化项防止表征崩溃:1)冗余正则化项,用于降低质心不变特征间的维度间相关性;2)不公平正则化项,用于最大化原型质心的预测熵,从而惩罚偏向任何特定类别的有偏表征。令人鼓舞的结果表明,在上述真实测试场景下,我们的方法比先前方法表现得更稳定,且计算效率高。

关键词

引用

@article{arxiv.2509.04977,
  title  = {Adapt in the Wild: Test-Time Entropy Minimization with Sharpness and Feature Regularization},
  author = {Shuaicheng Niu and Guohao Chen and Deyu Chen and Yifan Zhang and Jiaxiang Wu and Zhiquan Wen and Yaofo Chen and Peilin Zhao and Chunyan Miao and Mingkui Tan},
  journal= {arXiv preprint arXiv:2509.04977},
  year   = {2025}
}

备注

25 pages, 27 tables, 14 figures. arXiv admin note: substantial text overlap with arXiv:2302.12400