基于双图与门控融合聚合特征的视频描述生成
计算机视觉与模式识别
2023-08-15 v1 人工智能
摘要
视频描述生成模型的应用旨在利用准确的自然语言翻译视频内容。由于视频中物体交互的复杂本质,对物体时空关系的全面理解仍是一项挑战性任务。现有方法常未能生成充分的视频内容特征表示。本文提出一种基于双图与门控融合的视频描述生成模型:我们采用两类图生成视频内容特征表示,并利用门控融合进一步理解这些不同层次的信息。使用双图模型分别生成外观特征与运动特征,可利用帧间内容相关性从多视角生成多样特征。其中,双图推理可增强帧序列中的内容相关性以生成高级语义特征;而门控融合则聚合多特征表示中的信息以实现全面的视频内容理解。在常用数据集 MSVD 与 MSR-VTT 上的实验表明了我们所提方法的 SOTA 性能。
引用
@article{arxiv.2308.06685,
title = {Video Captioning with Aggregated Features Based on Dual Graphs and Gated Fusion},
author = {Yutao Jin and Bin Liu and Jing Wang},
journal= {arXiv preprint arXiv:2308.06685},
year = {2023}
}