在视频问答中尝试双线性池化
计算机视觉与模式识别
2020-12-21 v1 计算与语言
摘要
双线性池化(BLP)是指一类近期为融合来自不同模态的特征而开发的运算,主要用于VQA模型。双线性(外积)展开被认为能鼓励模型学习两个特征空间之间的交互,并在VQA基准上经实验优于“更简单的”向量运算(拼接与逐元素加/乘)。后续的BLP技术以更低计算代价取得了更高性能,且常与注意力机制一同实现。然而,尽管VQA取得了显著进展,BLP方法尚未被广泛应用于近来被探索的视频问答(video-QA)任务。本文中,我们开始弥合这一研究空白,将BLP技术应用于多个video-QA基准,即:TVQA、TGIF-QA、Ego-VQA和MSVD-QA。我们分享了在TVQA基线模型以及近期提出的异质记忆增强多模态注意力(HME)模型上的结果。我们的实验既包括简单地将现有模型中的特征拼接替换为BLP,也包括对TVQA基线进行修改以适配BLP的“双流”模型。我们发现,这种相对简单的BLP集成并未提升、且大多损害了这些video-QA基准上的性能。利用近期提出的理论多模态融合分类法,我们深入分析了为何BLP在video-QA基准上取得性能提升可能比在早期VQA模型中更困难。我们提出了在video-QA中应用BLP时值得考虑的若干额外“最佳实践”。我们强调,video-QA模型应仔细考量BLP复杂表示潜力真正所需之处,以避免在“冗余”融合上耗费计算代价。
引用
@article{arxiv.2012.10285,
title = {Trying Bilinear Pooling in Video-QA},
author = {Thomas Winterbottom and Sarah Xiao and Alistair McLean and Noura Al Moubayed},
journal= {arXiv preprint arXiv:2012.10285},
year = {2020}
}
备注
16 Pages, 8 Figures, 4 Tables, +Supp Mats