中文

SiRi:一种基于Transformer视觉定位的简单选择性重训练机制

计算机视觉与模式识别 2022-07-28 v1

摘要

本文研究如何利用现代视觉-语言Transformer实现更好的视觉定位,并针对这一具有挑战性的任务提出了一种简单而强大的选择性重训练(SiRi)机制。具体而言,SiRi向视觉定位研究传达了一个重要原则,即更好的初始化视觉-语言编码器将有助于模型收敛到更优的局部极小,从而提升性能。具体地,我们随训练进程持续更新编码器参数,同时周期性地重新初始化其余参数,以迫使模型基于增强的编码器获得更好的优化。SiRi在三个流行基准上显著优于以往方法。具体而言,我们的方法在RefCOCO+ testA上取得83.04%的Top1准确率,比最先进方法(从头训练)高出10.21%以上。此外,我们揭示即使训练数据有限,SiRi也表现得出奇地优越。我们还将该方法扩展到基于Transformer的视觉定位模型及其他视觉-语言任务以验证其有效性。

关键词

引用

@article{arxiv.2207.13325,
  title  = {SiRi: A Simple Selective Retraining Mechanism for Transformer-based Visual Grounding},
  author = {Mengxue Qu and Yu Wu and Wu Liu and Qiqi Gong and Xiaodan Liang and Olga Russakovsky and Yao Zhao and Yunchao Wei},
  journal= {arXiv preprint arXiv:2207.13325},
  year   = {2022}
}

备注

21 pages (including Supplementary Materials); Accepted to ECCV 2022