LocCa:基于位置感知描述器的视觉预训练
计算机视觉与模式识别
2024-11-13 v2
摘要
图像描述已被证明是一种与对比预训练类似的有效预训练方法。然而,将位置感知信息纳入视觉预训练仍然是一个研究有限的领域。在本文中,我们提出了一种使用位置感知描述器(LocCa)的简单视觉预训练方法。LocCa 使用简单的图像描述器任务接口,教导模型在图像像素输入的条件下读出丰富的信息,即边界框坐标和描述。得益于编码器-解码器架构的多任务能力,我们表明图像描述器可以在预训练期间轻松处理多个任务。我们的实验表明,LocCa 在定位下游任务上显著优于标准描述器,同时在整体任务上保持可比的性能。
引用
@article{arxiv.2403.19596,
title = {LocCa: Visual Pretraining with Location-aware Captioners},
author = {Bo Wan and Michael Tschannen and Yongqin Xian and Filip Pavetic and Ibrahim Alabdulmohsin and Xiao Wang and André Susano Pinto and Andreas Steiner and Lucas Beyer and Xiaohua Zhai},
journal= {arXiv preprint arXiv:2403.19596},
year = {2024}
}