中文

理解测试时自适应中带硬伪标签与共轭伪标签的梯度下降

机器学习 2023-02-28 v4

摘要

我们考虑如下设定:模型需要在分布偏移下适应新域,且在测试时仅能获取来自新域的无标签测试样本。大多数相关工作的一个共同思路是为无标签测试样本构造伪标签,并对带伪标签的损失函数应用梯度下降(GD)。最近,\cite{GSRK22} 提出共轭标签,这是一种用于测试时自训练的新型伪标签。他们通过实验表明,在许多域适应基准上共轭标签优于其他伪标签方式。然而,证明带共轭标签的 GD 能学习到测试时自适应的良好分类器仍属开放问题。本文旨在从理论上理解二分类问题中带硬标签与共轭标签的 GD。我们表明,对于平方损失,在高斯模型下带共轭标签的 GD 对任意任意小的 ϵ\epsilon 收敛到 ϵ\epsilon-最优预测器,而带硬伪标签的 GD 在此任务中失败。我们还分析了在不同更新损失函数下二者的情况。我们的结果有助于理解测试时自适应中带硬标签或共轭标签的 GD 何时及为何有效。

关键词

引用

@article{arxiv.2210.10019,
  title  = {Towards Understanding GD with Hard and Conjugate Pseudo-labels for Test-Time Adaptation},
  author = {Jun-Kun Wang and Andre Wibisono},
  journal= {arXiv preprint arXiv:2210.10019},
  year   = {2023}
}

备注

Accepted at ICLR (International Conference on Learning Representations), 2023