基于场景图的图像检索——以CLEVR数据集为例
人工智能
2019-11-05 v1 计算与语言
计算机视觉与模式识别
摘要
随着多模态交互在各领域的扩散,近期计算机视觉界对基于文本的图像检索兴趣浓厚。然而,大多数SOTA技术以纯神经方式建模该问题,难以在大规模目录检索中融入语用策略,尤其在搜索需求不充分、模型需通过多轮问答交互检索时。受此驱动,我们提出一种神经-符号方法,用于给定描述文本时从大规模目录中一次性检索图像。为此,我们将目录与描述表示为场景图,并将检索任务建模为可学习的图匹配问题,以REINFORCE算法端到端训练。此外,我们简要描述了该流程基于交互式问答的迭代检索框架扩展。
引用
@article{arxiv.1911.00850,
title = {Scene Graph based Image Retrieval -- A case study on the CLEVR Dataset},
author = {Sahana Ramnath and Amrita Saha and Soumen Chakrabarti and Mitesh M. Khapra},
journal= {arXiv preprint arXiv:1911.00850},
year = {2019}
}
备注
3 pages including references, Accepted at the ICCV 2019 Workshop - 'Linguistics Meets Image and Video Retrieval' (received Best Paper Award)