多模态指代:一种用于视频对象分割的统一时序Transformer
计算机视觉与模式识别
2023-12-13 v2 人工智能
多媒体
摘要
近年来,由多模态信号(如语言和音频)指代的视频对象分割(VOS)在工业界和学术界引起了越来越多的关注。探索模态内的语义对齐以及跨帧的视觉对应具有挑战性。然而,现有方法针对不同模态采用分离的网络架构,并且忽视了带有指代信息的帧间时序交互。本文中,我们提出MUTR,一种用于指代式视频对象分割的多模态统一时序Transformer(Multi-modal Unified Temporal transformer)。MUTR首次采用统一框架,使用DETR风格的Transformer,能够对由文本或音频指代指定的视频对象进行分割。具体而言,我们引入两种策略来充分挖掘视频与多模态信号之间的时序关系。首先,对于Transformer之前的低层时序聚合,我们使多模态指代能够从连续视频帧中捕获多尺度视觉线索。这有效地赋予了文本或音频信号时序知识,并促进了模态间的语义对齐。其次,对于Transformer之后的高层时序交互,我们对不同的对象嵌入进行帧间特征通信,有助于沿视频更好地进行对象级对应跟踪。在分别带有文本和音频指代的Ref-YouTube-VOS和AVSBench数据集上,MUTR相较最先进(SOTA)方法分别取得了+4.2%和+8.7%的J&F提升,证明了我们统一多模态VOS的重要性。代码发布于https://github.com/OpenGVLab/MUTR。
引用
@article{arxiv.2305.16318,
title = {Referred by Multi-Modality: A Unified Temporal Transformer for Video Object Segmentation},
author = {Shilin Yan and Renrui Zhang and Ziyu Guo and Wenchao Chen and Wei Zhang and Hongyang Li and Yu Qiao and Hao Dong and Zhongjiang He and Peng Gao},
journal= {arXiv preprint arXiv:2305.16318},
year = {2023}
}
备注
Accepted by AAAI 2024. Code is released at https://github.com/OpenGVLab/MUTR