用于视频字幕的双层级解耦Transformer
计算机视觉与模式识别
2022-05-09 v1
摘要
视频字幕旨在理解视频的时空语义概念并生成描述性句子。该任务的既定方法规定文本生成器从\textit{预训练}视觉模型中\textit{离线提取}的运动或外观特征学习。然而,这些方法可能在\textit{视频时空表示}与\textit{句子生成}两方面均受所谓\textbf{\textit{“耦合”}}缺陷的困扰。对前者,\textbf{\textit{“耦合”}}意指在单一模型(3DCNN)中学习时空表示,导致名为\emph{任务/预训练领域脱节}与\emph{难以端到端训练}的问题。至于后者,\textbf{\textit{“耦合”}}意谓对等对待视觉语义词与句法相关词的生成。为此,我们提出——一种双层级解耦Transformer流程以解决上述缺陷:\emph{(i)}对视频时空表示,我们将该过程解耦为“先空间后时间”范式,释放使用专用模型(\textit{如}图像-文本预训练)连接预训练与下游任务的潜力,并使整个模型可端到端训练。\emph{(ii)}对句子生成,我们提出\emph{句法感知解码器}以动态度量视觉语义与句法相关词的贡献。在三个广泛使用基准(MSVD、MSR-VTT与VATEX)上的大量实验显示了所提的巨大潜力,并在视频字幕任务上大幅超越先前方法。
引用
@article{arxiv.2205.03039,
title = {Dual-Level Decoupled Transformer for Video Captioning},
author = {Yiqi Gao and Xinglin Hou and Wei Suo and Mengyang Sun and Tiezheng Ge and Yuning Jiang and Peng Wang},
journal= {arXiv preprint arXiv:2205.03039},
year = {2022}
}