我想要这个产品但要不同:基于合成查询扩展的多模态检索
计算机视觉与模式识别
2021-07-01 v2 人工智能
摘要
本文解决了使用多模态查询(结合视觉输入与自然语言反馈中额外语义信息的查询)的媒体检索问题。我们提出了一种 SynthTriplet GAN 框架,该框架通过用捕获图像与文本输入中语义信息的合成生成图像来扩展多模态查询,从而解决此任务。我们引入了一种新颖的三元组挖掘方法,其使用合成图像作为锚点,直接优化生成图像与目标图像的嵌入距离。我们证明,除了以合成图像进行检索说明所带来的附加价值(侧重于定制与用户反馈)之外,所提方法大幅超越其他多模态生成方法,并在多模态检索任务中取得了最先进(state of the art)的结果。我们还表明,与其他检索方法相比,我们的方法提供了可解释的嵌入。
引用
@article{arxiv.2102.08871,
title = {I Want This Product but Different : Multimodal Retrieval with Synthetic Query Expansion},
author = {Ivona Tautkute and Tomasz Trzcinski},
journal= {arXiv preprint arXiv:2102.08871},
year = {2021}
}
备注
Major edits