MSG-BART:用于视频 grounded 对话生成的多粒度场景图增强编解码语言模型
计算机视觉与模式识别
2023-11-23 v1 人工智能
计算与语言
图像与视频处理
摘要
生成基于视频的对话需要对视频中视觉场景具备高水平的理解与推理能力。然而,现有的大型视觉-语言模型由于其潜在特征与仅解码器结构而效果不佳,尤其在时空关系推理方面。本文中,我们提出一种名为 MSG-BART 的新方法,通过将多粒度时空场景图融入编解码预训练语言模型来增强视频信息的整合。具体而言,我们将全局与局部场景图分别整合进编码器与解码器,以提升整体感知与目标推理能力。为进一步提升信息选择能力,我们提出多指针网络以促进文本与视频间的选择。在三个视频 grounded 对话基准上进行了大量实验,结果表明所提 MSG-BART 相比一系列最先进方法具有显著优越性。
引用
@article{arxiv.2311.12820,
title = {MSG-BART: Multi-granularity Scene Graph-Enhanced Encoder-Decoder Language Model for Video-grounded Dialogue Generation},
author = {Hongcheng Liu and Zhe Chen and Hui Li and Pingjie Wang and Yanfeng Wang and Yu Wang},
journal= {arXiv preprint arXiv:2311.12820},
year = {2023}
}
备注
5 pages,3 figures