中文

通过共轭伪标签进行测试时自适应

机器学习 2022-11-24 v2

摘要

测试时自适应(TTA)指在测试时仅能访问来自新领域的无标签测试样本的情况下,使神经网络适应分布偏移。先前的 TTA 方法在诸如 TENT [Wang et al., 2021] 中模型预测的熵等无监督目标上优化,但尚不清楚究竟什么构成良好的 TTA 损失。本文首先呈现一个令人惊讶的现象:若我们尝试在一大类函数上元学习最优可能的 TTA 损失,则会恢复出一个与 TENT 所用的 softmax 熵(其温度缩放版本)极为相似的函数。然而,这仅在我们所自适应的分类器通过交叉熵训练时成立;若通过平方损失训练,则会出现不同的最优 TTA 损失。为解释该现象,我们通过训练损失的凸共轭视角分析 TTA。我们表明在自然条件下,该(无监督)共轭函数可视为原始有监督损失的一个良好局部近似,且确实恢复了元学习所发现的最优损失。这导出了一条通用准则,可用于为一般类别的任意给定有监督训练损失函数找到良好的 TTA 损失。实证上,我们的方法在广泛基准上一致优于其他基线。我们的方法尤其适用于以新颖损失函数训练的分类器,例如最近提出的 PolyLoss,此时它与基于熵的损失大不相同(且表现更优)。此外,我们表明我们的方法也可解释为一种使用非常特定的软标签的自训练,我们称之为共轭伪标签。总体而言,我们的方法为更好地理解和改进测试时自适应提供了广阔框架。代码见 https://github.com/locuslab/tta_conjugate。

关键词

引用

@article{arxiv.2207.09640,
  title  = {Test-Time Adaptation via Conjugate Pseudo-labels},
  author = {Sachin Goyal and Mingjie Sun and Aditi Raghunathan and Zico Kolter},
  journal= {arXiv preprint arXiv:2207.09640},
  year   = {2022}
}

备注

Published in Neural Information Processing Systems (NeurIPS) 2022