用于带文本反馈视觉搜索的模态无关注意力融合
计算机视觉与模式识别
2020-07-02 v1 计算与语言
机器学习
摘要
基于自然语言反馈的图像检索有望实现基于细粒度视觉特征的目录搜索,超越物体与二值属性,助力电子商务等现实应用。我们的模态无关注意力融合(Modality-Agnostic Attention Fusion, MAAF)模型结合图像与文本特征,在两个带修改短语的视觉搜索数据集Fashion IQ和CSS上优于现有方法,并在仅含单词修改的数据集Fashion200k上具有竞争力。我们还引入了从Birds-to-Words和Spot-the-Diff改编的两个具丰富语言输入的新挑战性基准,并显示我们未经修改的方法优于强基线。为更好理解模型,我们在Fashion IQ上进行了详细消融实验,并可视化了词语“避免”关注其所指图像区域这一令人惊讶的现象。
引用
@article{arxiv.2007.00145,
title = {Modality-Agnostic Attention Fusion for visual search with text feedback},
author = {Eric Dodds and Jack Culpepper and Simao Herdade and Yang Zhang and Kofi Boakye},
journal= {arXiv preprint arXiv:2007.00145},
year = {2020}
}
备注
14 pages, 8 figures