中文

面向通用测试时自适应的自举方法

计算机视觉与模式识别 2025-04-14 v1 机器学习

摘要

在本文中,我们旨在为各种任务开发一种通用的测试时自适应目标——涵盖图像级、对象级和像素级预测的分类与回归。我们通过一种自举方案实现了这一点,该方案优化测试图像(作为目标)与其退化视图之间的预测一致性。关键挑战在于设计有效的增强/退化方法,使其:i) 保留图像的几何信息,例如对象大小和位置,这对于对象/像素级任务的TTA至关重要;ii) 为TTA提供充足的学习信号。为此,我们分析了常见的分布偏移如何在傅里叶域中影响图像跨空间频率的信息功率,并揭示了低频分量携带高功率,掩蔽这些分量能提供更多学习信号,而掩蔽高频分量则不能。有鉴于此,我们在图像傅里叶域中随机掩蔽其低频幅度以进行增强。同时,我们还通过噪声注入对图像进行增强,以通过增强高频处的信息功率来补偿那里缺失的学习信号。实验表明,无论是独立使用还是作为即插即用模块,我们的方法在分类、分割和3D单目检测任务中,使用Transformer和CNN模型均取得了优异的结果。

关键词

引用

@article{arxiv.2504.08010,
  title  = {Self-Bootstrapping for Versatile Test-Time Adaptation},
  author = {Shuaicheng Niu and Guohao Chen and Peilin Zhao and Tianyi Wang and Pengcheng Wu and Zhiqi Shen},
  journal= {arXiv preprint arXiv:2504.08010},
  year   = {2025}
}

备注

16 pages, 10 tables, 4 figures