通过测试时训练层学习生成用于测试时适应的梯度
机器学习
2024-12-24 v1 计算机视觉与模式识别
摘要
测试时适应 (TTA) 旨在使用无标签的测试数据在在线方式微调训练好的模型,以适应新环境或分布外数据,展现出在实际场景中的广泛应用潜力。然而,在该优化过程中,无监督学习目标(如熵最小化)常遇到噪声学习信号。这些信号产生不可靠的梯度,阻碍模型快速收敛至最优解,并在优化过程中引入显著不稳定性。本文从优化器设计角度寻求解决这些问题。不同于先前的 TTA 使用人工设计的优化器(如 SGD),我们采用学习-优化方法自动学习一种优化器,称为 Meta Gradient Generator (MGG)。具体而言,我们期望 MGG 在在线优化过程中有效利用历史梯度信息以优化当前模型。为此,在 MGG 中,我们设计了一种轻量且高效的序列建模层——梯度记忆层。它利用自监督重构损失将历史梯度信息压缩到网络参数中,从而实现对长期适应过程的更好记忆。我们仅需少量无标签样本进行预训练,即可将训练好的 MGG 部署到处理未见样本中。在 ImageNet-C、R、Sketch 和 A 上的实验证明,我们的方法在更少的更新、更少的数据和显著缩短的适应迭代次数下,超越了当前的 SOTA 方法。在 ImageNet-C 上,相较于前一方法 SAR,我们实现了 7.4% 的准确率提升和 4.2 倍的适应速度提升。
引用
@article{arxiv.2412.16901,
title = {Learning to Generate Gradients for Test-Time Adaptation via Test-Time Training Layers},
author = {Qi Deng and Shuaicheng Niu and Ronghao Zhang and Yaofo Chen and Runhao Zeng and Jian Chen and Xiping Hu},
journal= {arXiv preprint arXiv:2412.16901},
year = {2024}
}
备注
3 figures, 11 tables