面向运动感知的指涉图像分割
计算机视觉与模式识别
2026-03-19 v1
摘要
指涉图像分割(Referring Image Segmentation, RIS)要求基于文本描述从图像中识别对象。我们发现,现有方法在处理与运动相关的查询时表现显著低于基于外观的查询。为此,我们首先引入一种高效的数据增强方案,从原始标题中提取运动中心短语,使模型在无需额外标注的情况下接触更多运动表达。其次,由于同一对象在不同上下文中的描述可能不同,本文提出多模态径向对比学习(Multimodal Radial Contrastive Learning, MRaCL),其在融合后的图像-文本嵌入上实现,而非单模态表示。为进行全面评估,我们引入新的测试划分,聚焦于运动中心查询,并提出新的基准称为M-Bench,其中对象的区分主要基于动作。大量实验表明,我们的方法在跨多个RIS模型的运动中心查询上显著提升性能,同时保持对外观-based描述的竞争性能。代码已公开于https://github.com/snuviplab/MRaCL
引用
@article{arxiv.2603.17413,
title = {Towards Motion-aware Referring Image Segmentation},
author = {Chaeyun Kim and Seunghoon Yi and Yejin Kim and Yohan Jo and Joonseok Lee},
journal= {arXiv preprint arXiv:2603.17413},
year = {2026}
}
备注
Accepted at AISTATS 2026. * Equal contribution