基于语言对齐轨迹选择的指涉视频对象分割
计算机视觉与模式识别
2025-03-27 v2
摘要
指涉视频对象分割(RVOS)要求根据给定的自然语言表达式,对视频中的目标进行跟踪与分割,既需要复杂的运动理解,又需实现视觉表征与语言描述之间的对齐。面对这些挑战,最近提出的 Segment Anything Model 2(SAM2)因其能够生成视频帧间连贯的分割掩码轨迹,以及在对象 token 表示中内置时空目标性(spatio-temporal objectness)而成为有前景的候选方案。本文引入 SOLA(Selection by Object Language Alignment)框架,利用 SAM2 对象 token 作为紧凑的视频级对象表征,通过轻量级轨迹选择模块将其与语言特征对齐。为有效促进这种对齐,本文提出一种基于 IoU 的伪标签生成策略,桥接 SAM2 表征与语言特征之间的模态差距。大量实验表明,SOLA 在 MeViS 数据集上实现了最新成果,证明 SOLA 为 RVOS 提供了有效解决方案。项目页面:https://cvlab-kaist.github.io/SOLA
引用
@article{arxiv.2412.01136,
title = {Referring Video Object Segmentation via Language-aligned Track Selection},
author = {Seongchan Kim and Woojeong Jin and Sangbeom Lim and Heeji Yoon and Hyunwook Choi and Seungryong Kim},
journal= {arXiv preprint arXiv:2412.01136},
year = {2025}
}
备注
Project page is available at https://cvlab-kaist.github.io/SOLA