MED-VT++:以多尺度编码器-解码器视频 Transformer 统一多模态学习
计算机视觉与模式识别
2024-09-18 v3
摘要
在本文中,我们提出一个端到端可训练的统一种多尺度编码器-解码器 Transformer,专注于视频中的密集预测任务。所提出的多尺度编码器-解码器视频 Transformer(MED-VT)全程使用多尺度表示,并在可用时采用视频之外的可选输入(例如音频)进行多模态处理(MED-VT++)。编码器与解码器上的多尺度表示带来三个关键益处:(i) 在不同抽象层级隐式提取时空特征以捕捉动态,而无需依赖输入光流,(ii) 编码时的时间一致性,以及 (iii) 从粗到细的检测以将高级(例如物体)语义用于引导解码时的精确定位。此外,我们提出了一种通过多对多标签传播的导出学习方案,以提供时间一致的视频预测。我们在三个单模态视频分割任务(自动视频物体分割(AVOS)、行为-动作分割和视频语义分割(VSS))以及一个多模态分割任务(音视分割(AVS))上展示了 MED-VT/MED-VT++。结果表明,所提架构在仅使用视频(及可选音频)作为输入、不依赖光流的情况下,在多个基准上优于替代的 SOTA 方法。最后,为记录模型内部学习表示的细节,我们给出了一个涵盖定量与定性分析的详细可解释性研究。
引用
@article{arxiv.2304.05930,
title = {MED-VT++: Unifying Multimodal Learning with a Multiscale Encoder-Decoder Video Transformer},
author = {Rezaul Karim and He Zhao and Richard P. Wildes and Mennatullah Siam},
journal= {arXiv preprint arXiv:2304.05930},
year = {2024}
}
备注
Extension of CVPR'23 paper for journal submission