BiST:用于视频依据对话的双向时空推理
计算机视觉与模式识别
2020-10-21 v1 计算与语言
机器学习
摘要
视频依据对话非常具有挑战性,原因在于(i)视频的复杂性,其包含空间和时间上的变化;以及(ii)用户话语的复杂性,其在多个对话轮次中查询视频中不同的片段和/或不同的对象。然而,现有的视频依据对话方法通常关注浅层的时间级视觉线索,而忽略来自视频的更细粒度的空间信号。为应对这一缺陷,我们提出双向时空学习(BiST),一种基于文本线索对视频中高分辨率查询进行处理的视觉-语言神经框架。具体而言,我们的方法不仅利用空间级和时间级信息,还通过空间到时间和时间到空间的推理学习两个特征空间之间的动态信息扩散。该双向策略旨在应对对话设定中用户查询的不断演化语义。检索到的视觉线索被用作上下文信息以构建对用户的相应回复。我们的实证结果与全面的定性分析表明,BiST 在大规模 AVSD 基准上取得了有竞争力的性能并生成合理的回复。我们还将 BiST 模型适配到视频问答(Video QA)设定,并在 TGIF-QA 基准上大幅优于先前的方法。
引用
@article{arxiv.2010.10095,
title = {BiST: Bi-directional Spatio-Temporal Reasoning for Video-Grounded Dialogues},
author = {Hung Le and Doyen Sahoo and Nancy F. Chen and Steven C. H. Hoi},
journal= {arXiv preprint arXiv:2010.10095},
year = {2020}
}