SimToken:面向指涘音视频分割的简单基线
计算机视觉与模式识别
2025-09-24 v2
摘要
指涘音视频分割(Ref-AVS)旨在基于包含音频、视觉和文本信息的自然语言表达式,对视频中的特定对象进行细粒度分割。该任务在跨模态推理和精细对象定位方面存在显著挑战。本文提出一种简单框架 SimToken,将多模态大语言模型(MLLM)与 Segment Anything Model(SAM)集成。MLLM 通过生成代表被指对象的最特殊语义标记来获得指导。这个紧凑的标记经过所有模态上下文信息的丰富化,作为提示用于指导 SAM 在视频帧中进行对象分割。为进一步提高语义学习,我们引入一种新颖的目标一致性语义对齐损失,以对不同表达式但指代相同对象的标记嵌入进行对齐。在 Ref-AVS 基准测试上的实验表明,我们的方法在现有方法性能方面表现优异。
引用
@article{arxiv.2509.17537,
title = {SimToken: A Simple Baseline for Referring Audio-Visual Segmentation},
author = {Dian Jin and Yanghao Zhou and Jinxing Zhou and Jiaqi Ma and Ruohao Guo and Dan Guo},
journal= {arXiv preprint arXiv:2509.17537},
year = {2025}
}
备注
Project page: https://github.com/DianJin-HFUT/SimToken