循环一致性学习用于图像描述与视觉定位
计算机视觉与模式识别
2023-12-27 v1
摘要
我们提出,视觉定位和图像描述作为两个互逆的过程,可以通过精心设计桥接在一起进行协同训练。基于这一思想,我们引入了CyCo,一个循环一致性学习框架,以改进视觉定位和图像描述的独立训练流程。所提出的框架:(1) 允许视觉定位的半弱监督训练;(2) 提升全监督视觉定位的性能;(3) 产生一个能够描述任意图像区域的通用图像描述模型。大量实验表明,我们的全监督定位模型达到了最先进的性能,而半弱监督模型也表现出与全监督模型相竞争的性能。我们的图像描述模型能够自由描述图像区域,同时在主流图像描述基准上展现出令人印象深刻的性能。
引用
@article{arxiv.2312.15162,
title = {Cycle-Consistency Learning for Captioning and Grounding},
author = {Ning Wang and Jiajun Deng and Mingbo Jia},
journal= {arXiv preprint arXiv:2312.15162},
year = {2023}
}
备注
To appear in AAAI 2024