面向文本到图像检索的跨模态连贯性
计算机视觉与模式识别
2022-04-18 v2
摘要
常见的图像-文本联合理解技术假定图像与关联文本普遍可由单一隐式模型刻画。然而,共现的图像与文本可能以性质不同的方式相关联,显式建模这种关系可改进当前联合理解模型的性能。本文中,我们为文本到图像检索任务训练了一个跨模态连贯性模型。我们的分析表明,以图像-文本连贯关系训练的模型比连贯性无关的模型更频繁地检索到与目标文本原始配对的图片。我们还通过人工评估表明,所提连贯性感知模型检索的图像在极大程度上优于连贯性无关的基线。我们的发现为不同模态的交流方式以及连贯关系在捕捉文本与图像中的常识推理中的作用提供了见解。
引用
@article{arxiv.2109.11047,
title = {Cross-Modal Coherence for Text-to-Image Retrieval},
author = {Malihe Alikhani and Fangda Han and Hareesh Ravi and Mubbasir Kapadia and Vladimir Pavlovic and Matthew Stone},
journal= {arXiv preprint arXiv:2109.11047},
year = {2022}
}
备注
This paper is published in AAAI-2022