中文

基于双图与门控融合聚合特征的视频描述生成

计算机视觉与模式识别 2023-08-15 v1 人工智能

摘要

视频描述生成模型的应用旨在利用准确的自然语言翻译视频内容。由于视频中物体交互的复杂本质,对物体时空关系的全面理解仍是一项挑战性任务。现有方法常未能生成充分的视频内容特征表示。本文提出一种基于双图与门控融合的视频描述生成模型:我们采用两类图生成视频内容特征表示,并利用门控融合进一步理解这些不同层次的信息。使用双图模型分别生成外观特征与运动特征,可利用帧间内容相关性从多视角生成多样特征。其中,双图推理可增强帧序列中的内容相关性以生成高级语义特征;而门控融合则聚合多特征表示中的信息以实现全面的视频内容理解。在常用数据集 MSVD 与 MSR-VTT 上的实验表明了我们所提方法的 SOTA 性能。

关键词

引用

@article{arxiv.2308.06685,
  title  = {Video Captioning with Aggregated Features Based on Dual Graphs and Gated Fusion},
  author = {Yutao Jin and Bin Liu and Jing Wang},
  journal= {arXiv preprint arXiv:2308.06685},
  year   = {2023}
}