中文

ACTRESS:半监督视觉定位的主动重训练方法

计算机视觉与模式识别 2024-07-09 v2

摘要

半监督视觉定位(SSVG)因稀疏标注数据和多模型理解需求而成为一项新挑战。先前研究RefTeacher通过采用教师-学生框架提供伪置信度监督和注意力监督来解决此任务,但该方法与当前遵循基于Transformer管线的前沿视觉定位模型不兼容。这些管线直接回归结果,无区域提议或前景二元分类,因而缺乏置信度分数,无法适配RefTeacher。此外,教师和学生输入之间因不同数据增强导致的几何差异,引发注意力约束中的自然错位。为建立兼容的SSVG框架,本文提出ACTive REtraining方法,用于半监督视觉定位,简称ACTRESS。首先,通过纳入额外的量化检测头来暴露检测置信度,增强模型。随后,ACTRESS包含主动采样策略和选择性重训练策略。主动采样策略通过评估忠实性、鲁棒性和置信度三个关键方面,迭代选择高质量伪标签,优化无标签数据的利用。选择性重训练策略通过定期重新初始化特定参数来实现模型逃离局部最优。大量实验表明,我们在广泛使用的基准数据集上实现了卓越的性能。

关键词

引用

@article{arxiv.2407.03251,
  title  = {ACTRESS: Active Retraining for Semi-supervised Visual Grounding},
  author = {Weitai Kang and Mengxue Qu and Yunchao Wei and Yan Yan},
  journal= {arXiv preprint arXiv:2407.03251},
  year   = {2024}
}