面向未裁剪视频的多样化段落描述生成
计算机视觉与模式识别
2021-06-01 v1
摘要
视频段落描述生成旨在用描述性段落刻画未裁剪视频中的多个事件。现有方法主要分两步解决该问题:事件检测而后事件描述。这种两步方式使生成段落的质量高度依赖于事件提议检测的准确性,而后者本身即是一项具有挑战性的任务。本文提出一种段落描述模型,其避开有问题的事件检测阶段,直接为未裁剪视频生成段落。为描述连贯且多样的事件,我们提出以动态视频记忆增强常规时间注意力,其逐步暴露新视频特征并抑制过度访问的视频内容,以控制模型的视觉焦点。此外,提出一种多样性驱动的训练策略,从语言角度提升段落多样性。考虑到未裁剪视频通常包含海量但冗余的帧,我们进一步以关键帧感知增强视频编码器以提升效率。在 ActivityNet 与 Charades 数据集上的实验结果表明,无需任何事件边界标注,我们提出的模型在准确性与多样性指标上均显著优于当前最优性能。代码将发布于 https://github.com/syuqings/video-paragraph。
引用
@article{arxiv.2105.14477,
title = {Towards Diverse Paragraph Captioning for Untrimmed Videos},
author = {Yuqing Song and Shizhe Chen and Qin Jin},
journal= {arXiv preprint arXiv:2105.14477},
year = {2021}
}
备注
Accepted by CVPR 2021