理解测试时自适应中带硬伪标签与共轭伪标签的梯度下降
机器学习
2023-02-28 v4
摘要
我们考虑如下设定:模型需要在分布偏移下适应新域,且在测试时仅能获取来自新域的无标签测试样本。大多数相关工作的一个共同思路是为无标签测试样本构造伪标签,并对带伪标签的损失函数应用梯度下降(GD)。最近,\cite{GSRK22} 提出共轭标签,这是一种用于测试时自训练的新型伪标签。他们通过实验表明,在许多域适应基准上共轭标签优于其他伪标签方式。然而,证明带共轭标签的 GD 能学习到测试时自适应的良好分类器仍属开放问题。本文旨在从理论上理解二分类问题中带硬标签与共轭标签的 GD。我们表明,对于平方损失,在高斯模型下带共轭标签的 GD 对任意任意小的 收敛到 -最优预测器,而带硬伪标签的 GD 在此任务中失败。我们还分析了在不同更新损失函数下二者的情况。我们的结果有助于理解测试时自适应中带硬标签或共轭标签的 GD 何时及为何有效。
引用
@article{arxiv.2210.10019,
title = {Towards Understanding GD with Hard and Conjugate Pseudo-labels for Test-Time Adaptation},
author = {Jun-Kun Wang and Andre Wibisono},
journal= {arXiv preprint arXiv:2210.10019},
year = {2023}
}
备注
Accepted at ICLR (International Conference on Learning Representations), 2023