中文

面向通用指代视频对象分割的表达提示协作 Transformer

计算机视觉与模式识别 2025-01-20 v2 音频与语音处理 图像与视频处理

摘要

音频引导视频对象分割 (A-VOS) 与指代视频对象分割 (R-VOS) 是两个高度相关的任务,均旨在根据表达提示从视频序列中分割特定对象。然而,由于对不同模态建模表示的挑战,现有方法难以在交互灵活性与定位精度之间取得平衡。本文从两个角度解决该问题:音频与文本的对齐,以及音频、文本与视觉模态间的深度交互。首先,我们提出一种通用架构,即表达提示协作 Transformer,简称 EPCFormer。接下来,我们提出一种用于音频与文本的表达对齐 (EA) 机制。所提出的 EPCFormer 利用指代同一对象的音频与文本提示在语义上等价这一事实,通过对两类表达使用对比学习来实现。然后,为促进音频、文本与视觉模态间的深度交互,我们引入表达-视觉注意力 (EVA) 模块。关于表达提示的视频对象分割知识可通过深入挖掘文本与音频间的互补线索,在两项任务间无缝迁移。在公认基准上的实验表明,我们的 EPCFormer 在两项任务上均取得了最先进 (SOTA) 结果。源代码将在 https://github.com/lab206/EPCFormer 公开。

关键词

引用

@article{arxiv.2308.04162,
  title  = {Expression Prompt Collaboration Transformer for Universal Referring Video Object Segmentation},
  author = {Jiajun Chen and Jiacheng Lin and Guojin Zhong and Haolong Fu and Ke Nai and Kailun Yang and Zhiyong Li},
  journal= {arXiv preprint arXiv:2308.04162},
  year   = {2025}
}

备注

Accepted to Knowledge-Based Systems (KBS). The source code will be made publicly available at https://github.com/lab206/EPCFormer