用于跨模态检索的多义视觉-语义嵌入
计算机视觉与模式识别
2019-07-18 v2
摘要
视觉-语义嵌入旨在寻找一个共享的潜在空间,使得相关的视觉和文本实例在该空间中彼此靠近。当前大多数方法学习将实例映射到共享空间中单个点的单射嵌入函数。遗憾的是,单射嵌入无法有效处理具有多种可能含义的多义实例;它最多只能找到不同含义的平均表示。这阻碍了其在现实场景中的应用,因为个体实例及其跨模态关联常常是模糊的。在这项工作中,我们引入了多义实例嵌入网络(PIE-Nets),该网络通过多头自注意力和残差学习将全局上下文与局部引导特征相结合,计算实例的多个多样化表示。为了学习视觉-语义嵌入,我们将两个 PIE-Net 联结起来,并在多实例学习框架中联合优化它们。现有大多数跨模态检索工作集中于图像-文本数据。在此,我们还处理了更具挑战性的视频-文本检索情况。为了促进视频-文本检索的进一步研究,我们发布了一个从社交媒体收集的包含 5 万个视频-句子对的新数据集,称为 MRW(我的反应)。我们在图像-文本和视频-文本检索场景下,使用 MS-COCO、TGIF 和我们新的 MRW 数据集展示了我们的方法。
引用
@article{arxiv.1906.04402,
title = {Polysemous Visual-Semantic Embedding for Cross-Modal Retrieval},
author = {Yale Song and Mohammad Soleymani},
journal= {arXiv preprint arXiv:1906.04402},
year = {2019}
}
备注
CVPR 2019. Includes supplementary material. Have updated results on TGIF and MRW