更好地利用视听线索:基于双模态 Transformer 的密集视频描述
计算机视觉与模式识别
2020-08-12 v2 计算与语言
机器学习
声音
音频与语音处理
摘要
密集视频描述旨在定位并描述未裁剪视频中的重要事件。现有方法主要通过仅利用视觉特征来处理该任务,而完全忽略音轨。仅有少数先前工作使用了两种模态,但它们结果较差或仅在具有特定领域的数据集上证明了其重要性。本文中,我们引入双模态 Transformer(Bi-modal Transformer),将 Transformer 架构推广至双模态输入。我们在密集视频描述任务上展示了所提模型在音频与视觉模态上的有效性,但该模块能够处理序列到序列任务中任意两种模态。我们还展示了作为双模态 Transformer 一部分的预训练双模态编码器可用作简单提案生成模块的特征提取器。在具有挑战性的 ActivityNet Captions 数据集上展示了性能,我们的模型取得了优异表现。代码可用:v-iashin.github.io/bmt
引用
@article{arxiv.2005.08271,
title = {A Better Use of Audio-Visual Cues: Dense Video Captioning with Bi-modal Transformer},
author = {Vladimir Iashin and Esa Rahtu},
journal= {arXiv preprint arXiv:2005.08271},
year = {2020}
}
备注
Accepted by BMVC 2020. More experiments. Code: https://github.com/v-iashin/bmt Project page: https://v-iashin.github.io/bmt