基于分层卷积自注意力网络的开式长视频问答
计算机视觉与模式识别
2019-07-01 v1 机器学习
摘要
开式视频问答旨在根据给定问题,从所引用的视频内容中自动生成自然语言答案。目前,大多数现有方法聚焦于使用多模态循环编码器-解码器网络的短视频问答。尽管这些工作取得了可喜性能,但由于缺乏长程依赖建模且承受沉重计算成本,它们应用于长视频问答时可能仍效率低。为应对这些问题,我们提出一种快速的分层卷积自注意力编码器-解码器网络(HCSA)。具体而言,我们首先开发分层卷积自注意力编码器以高效建模长视频内容,其为视频序列构建分层结构并从视频上下文捕获问题感知的长程依赖。我们随后设计多尺度注意力解码器以融合多层视频表示用于答案生成,从而避免顶层编码器层的信息缺失。大量实验显示了我们方法的有效性与高效性。
引用
@article{arxiv.1906.12158,
title = {Open-Ended Long-Form Video Question Answering via Hierarchical Convolutional Self-Attention Networks},
author = {Zhu Zhang and Zhou Zhao and Zhijie Lin and Jingkuan Song and Xiaofei He},
journal= {arXiv preprint arXiv:1906.12158},
year = {2019}
}
备注
Accepted by IJCAI 2019 as a poster paper