面向视觉问答的紧凑三线性交互
计算机视觉与模式识别
2019-09-27 v1
摘要
在视觉问答(VQA)中,答案与问题语义及视觉内容高度相关。为此,为选择性地利用图像、问题和答案信息,我们提出一种新颖的三线性交互模型,同时学习这三个输入之间的高层关联。此外,为克服交互复杂度,我们引入基于多模态张量的 PARALIND 分解,高效参数化三输入间的三线性交互。而且,知识蒸馏首次应用于自由形式开放式 VQA,其不仅用于降低计算成本与所需内存,还将知识从三线性交互模型迁移至双线性交互模型。在基准数据集 TDIUC、VQA-2.0 和 Visual7W 上的大量实验表明,所提出的紧凑三线性交互模型在三个数据集上仅使用单一模型即达到了最先进的性能。
引用
@article{arxiv.1909.11874,
title = {Compact Trilinear Interaction for Visual Question Answering},
author = {Tuong Do and Thanh-Toan Do and Huy Tran and Erman Tjiputra and Quang D. Tran},
journal= {arXiv preprint arXiv:1909.11874},
year = {2019}
}
备注
Accepted in ICCV 2019