ViSTA:面向跨模态检索的视觉与场景文本聚合框架
计算机视觉与模式识别
2022-04-01 v1
摘要
视觉外观被视为跨模态检索中理解图像最重要的线索,而图像中出现的场景文本有时可提供理解视觉语义的宝贵信息。现有多数跨模态检索方法忽略场景文本信息的使用,且直接加入该信息可能导致在无场景文本场景下性能下降。为解决此问题,我们提出一种全 transformer 架构,以在单一 sion and cene ext ggregation 框架 (ViSTA) 中统一这些跨模态检索场景。具体而言,ViSTA 利用 transformer 模块直接编码图像块并融合场景文本嵌入,以学习用于跨模态检索的聚合视觉表示。为应对场景文本的模态缺失问题,我们提出一种基于融合令牌的 transformer 聚合方法,仅通过融合令牌交换必要的场景文本信息,并聚焦于各模态中最重要的特征。为进一步增强视觉模态,我们设计了双重对比学习损失,将图像-文本对与融合-文本对嵌入至公共跨模态空间。与现有方法相比,ViSTA 能够聚合相关的场景文本语义与视觉外观,从而在无场景文本与有场景文本场景下均改善结果。实验结果表明,在场景文本感知检索任务中,ViSTA 的 Recall@1 至少优于其他方法 。与最先进的场景文本无关检索方法相比,ViSTA 在 Flicker30K 与 MSCOCO 上取得更优精度,且推理阶段至少快三倍,验证了所提框架的有效性。
引用
@article{arxiv.2203.16778,
title = {ViSTA: Vision and Scene Text Aggregation for Cross-Modal Retrieval},
author = {Mengjun Cheng and Yipeng Sun and Longchao Wang and Xiongwei Zhu and Kun Yao and Jie Chen and Guoli Song and Junyu Han and Jingtuo Liu and Errui Ding and Jingdong Wang},
journal= {arXiv preprint arXiv:2203.16778},
year = {2022}
}
备注
Accepted by CVPR 2022