GL-RG:面向视频字幕的全局-局部表示粒度框架
计算机视觉与模式识别
2023-03-01 v2
摘要
视频字幕是一项具有挑战性的任务,因为它需要准确地将视觉理解转化为自然语言描述。迄今为止,最先进的方法未能充分建模跨视频帧的全局-局部表示以生成字幕,留下了大量改进空间。在本工作中,我们从一个新视角切入视频字幕任务,并提出一种用于视频字幕的 GL-RG 框架,即\textbf{全}局-\textbf{局}部\textbf{表}示\textbf{粒}度(\textbf{G}lobal-\textbf{L}ocal \textbf{R}epresentation \textbf{G}ranularity)。我们的 GL-RG 相较先前工作展现出三点优势:1) 我们显式地利用来自不同视频范围的广泛视觉表示以改善语言表达;2) 我们设计了一种新颖的全局-局部编码器,以产生丰富的语义词汇,从而获得跨帧视频内容的描述性粒度;3) 我们开发了一种增量训练策略,以增量方式组织模型学习,从而诱发最优的字幕行为。在具有挑战性的 MSR-VTT 与 MSVD 数据集上的实验结果表明,我们的 DL-RG 以显著优势超越近期最先进的方法。代码见 \url{https://github.com/ylqi/GL-RG}。
引用
@article{arxiv.2205.10706,
title = {GL-RG: Global-Local Representation Granularity for Video Captioning},
author = {Liqi Yan and Qifan Wang and Yiming Cui and Fuli Feng and Xiaojun Quan and Xiangyu Zhang and Dongfang Liu},
journal= {arXiv preprint arXiv:2205.10706},
year = {2023}
}
备注
Accepted to IJCAI 2022