对齐源视觉与目标语言域以实现无配对视频描述生成
计算机视觉与模式识别
2022-11-23 v1 机器学习
摘要
训练有监督的视频描述生成模型需要成对的视频-描述数据。然而,对于许多目标语言,充足的配对数据并不可用。为此,我们引入了无配对视频描述生成任务,旨在不使用目标语言中的成对视频-描述数据来训练模型。为解决该任务,一种自然的选择是采用两步流水线系统:首先利用视频到枢纽语言的描述生成模型生成枢纽语言描述,然后利用枢纽到目标语言的翻译模型将枢纽语言描述翻译为目标语言。然而,在这样的流水线系统中,1)视觉信息无法到达翻译模型,生成与视觉无关的目标描述;2)生成的枢纽语言描述中的错误会传播到翻译模型,导致不流畅的目标描述。为解决这些问题,我们提出了带视觉注入的无配对视频描述生成系统(UVC-VI)。UVC-VI首先引入视觉注入模块(VIM),其对齐源视觉域与目标语言域,以将源视觉信息注入目标语言域。同时,VIM直接连接视频到枢纽模型的编码器与枢纽到目标模型的解码器,通过完全跳过枢纽描述的生成来实现端到端推理。为增强VIM的跨模态注入,UVC-VI进一步引入了一个可插拔的视频编码器,即多模态协同编码器(MCE)。实验表明UVC-VI优于流水线系统,并超越若干有监督系统。此外,为现有有监督系统配备我们的MCE,在基准MSVD和MSR-VTT数据集上相对于当前最先进(SOTA)模型分别在CIDEr分数上取得4%和7%的相对提升。
引用
@article{arxiv.2211.12148,
title = {Aligning Source Visual and Target Language Domains for Unpaired Video Captioning},
author = {Fenglin Liu and Xian Wu and Chenyu You and Shen Ge and Yuexian Zou and Xu Sun},
journal= {arXiv preprint arXiv:2211.12148},
year = {2022}
}
备注
Published at IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)