一种用于视频问答与检索的联合序列融合模型
计算机视觉与模式识别
2018-08-09 v1
摘要
我们提出一种名为 JSFusion(Joint Sequence Fusion,联合序列融合)的方法,能够度量任意多模态序列数据对(例如视频片段与语言句子)之间的语义相似度。我们的多模态匹配网络由两个关键组件构成。首先,联合语义张量(Joint Semantic Tensor)将两个序列数据的稠密成对表示组合为一个三维张量。随后,卷积层次解码器(Convolutional Hierarchical Decoder)通过发现两个序列模态之间隐藏的层次匹配来计算它们的相似度分数。两个模块均利用层次注意力机制,以自底向上的方式学习提升匹配良好的表示模式并剪除错位的模式。尽管 JSFusion 是一个适用于任意多模态序列数据的通用模型,本工作聚焦于视频-语言任务,包括多模态检索与视频问答(video QA)。我们在 LSMDC 的三个检索与 VQA 任务上评估 JSFusion 模型,我们的模型取得了迄今为止报道的最佳性能。我们还在 MSR-VTT 数据集上执行多项选择与电影检索任务,我们的方法优于许多 SOTA 方法。
引用
@article{arxiv.1808.02559,
title = {A Joint Sequence Fusion Model for Video Question Answering and Retrieval},
author = {Youngjae Yu and Jongseok Kim and Gunhee Kim},
journal= {arXiv preprint arXiv:1808.02559},
year = {2018}
}
备注
To appear in ECCV 2018. 17 pages