利用音视觉 Transformer 优化在线视频描述延迟
计算机视觉与模式识别
2021-08-05 v1 计算与语言
摘要
视频描述是以自然语言理解场景并叙述事件的重要技术。为将其应用于实时监控,系统不仅需要准确描述事件,还需尽快生成描述。实现此类功能需要低延迟描述,但在线视频描述这一研究方向尚无人涉足。本文提出一种基于延迟与描述质量之间权衡来优化每条描述输出时序的新方法。训练一个音视觉 Transformer,仅使用全部视频帧的一小部分来生成真值描述,并模仿一个使用全部帧的预训练 Transformer 的输出。同时训练一个基于 CNN 的时序检测器,以检测两个 Transformer 生成的描述彼此足够接近的合适输出时机。通过联合训练的 Transformer 与时序检测器,可在事件触发视频片段的早期阶段、事件一发生或可预测时生成描述。在 ActivityNet Captions 数据集上的实验表明,我们的方法仅使用起始 28% 的帧,便达到了由使用完整视频片段的预训练 Transformer 给出的上限 94% 的描述质量。
引用
@article{arxiv.2108.02147,
title = {Optimizing Latency for Online Video CaptioningUsing Audio-Visual Transformers},
author = {Chiori Hori and Takaaki Hori and Jonathan Le Roux},
journal= {arXiv preprint arXiv:2108.02147},
year = {2021}
}
备注
Interspeech 2021 accepted