RTIC:基于图卷积网络的残差图文组合学习
计算机视觉与模式识别
2021-10-27 v3
摘要
本文研究用于图像检索的图文组合学习。查询由一幅图像和描述该图像所需修改的文本给出;目标是在同时考虑文本与图像模态信息的基础上,检索出满足给定修改且与查询相似的目标图像。为此,我们提出了一种专为图文组合任务设计的新型架构,并表明所提结构能有效编码以文本为条件的源图像与目标图像之间的差异。此外,我们引入了一种基于图卷积网络的联合训练技术,该技术以即插即用的方式普遍适用于任何现有组合方法。我们发现所提技术持续提高性能,并在多个基准上取得 SOTA 分数。为避免由平凡训练超参数导致的误导性实验结果,我们复现了所有独立基线并在统一训练环境下训练模型。我们期望该方法能抑制无关组件的不良影响,并突出图文组合模块的能力。同时,我们在不限制训练环境的情况下也取得了 SOTA 分数,考虑到超参数调优带来的增益,这暗示了我们所提方法的优越性。包含全部基线方法的代码已发布于 https://github.com/nashory/rtic-gcn-pytorch。
引用
@article{arxiv.2104.03015,
title = {RTIC: Residual Learning for Text and Image Composition using Graph Convolutional Network},
author = {Minchul Shin and Yoonjae Cho and Byungsoo Ko and Geonmo Gu},
journal= {arXiv preprint arXiv:2104.03015},
year = {2021}
}