面向对缺失模态鲁棒的多模态视频段落描述模型
计算机视觉与模式识别
2024-03-29 v1 人工智能
摘要
视频段落描述(VPC)涉及利用语音和事件边界等辅助模态为长视频生成详细叙述。然而,现有模型受限于单一辅助模态持续可用的假设,鉴于真实场景的多样性和不可预测性,这是不切实际的。为此,我们提出了一种抗缺失框架 MR-VPC,该框架能有效利用所有可用的辅助输入,并在某些模态缺失的情况下保持鲁棒性。在该框架下,我们提出了多模态 VPC(MVPC)架构,以统一的方式集成视频、语音和事件边界输入,以处理各种辅助输入。此外,为了增强模型对不完整数据的抵抗力,我们引入了 DropAM,一种随机省略辅助输入的数据增强策略,并配合 DistillAM,一种从在模态完整数据上训练的教师模型中提取知识的正则化目标,从而在模态缺失环境中实现高效学习。通过在 YouCook2 和 ActivityNet Captions 上的全面实验,MR-VPC 被证明在模态完整和模态缺失测试数据上均能提供卓越的性能。这项工作突出了开发鲁棒 VPC 模型的重要性,并为更具适应性、鲁棒性的多模态视频理解铺平了道路。
引用
@article{arxiv.2403.19221,
title = {Towards Multimodal Video Paragraph Captioning Models Robust to Missing Modality},
author = {Sishuo Chen and Lei Li and Shuhuai Ren and Rundong Gao and Yuanxin Liu and Xiaohan Bi and Xu Sun and Lu Hou},
journal= {arXiv preprint arXiv:2403.19221},
year = {2024}
}
备注
Code available at https://github.com/lancopku/MR-VPC