MeViS:用于指代运动表达视频分割的多模态数据集
计算机视觉与模式识别
2025-12-13 v1
摘要
本文提出一个大规模多模态数据集,用于指代运动表达视频分割,重点是基于语言描述的对象运动在视频中分割和跟踪目标对象。现有的指代视频分割数据集通常关注显著对象,并使用富含静态属性的语言表达,这可能允许在单帧中识别目标对象。这类数据集低估了运动在视频和语言中的作用。为了探索利用运动表达和运动推理线索进行像素级视频理解的可行性,我们引入了MeViS,一个包含33,072个人工标注的运动表达(文本和音频两种形式)的数据集,覆盖2,006个视频中的8,171个对象,场景复杂。我们在MeViS支持的4个任务上对15种现有方法进行了基准测试,包括6种指代视频目标分割(RVOS)方法、3种音频引导视频目标分割(AVOS)方法、2种指代多目标跟踪(RMOT)方法以及新引入的指代运动表达生成(RMEG)任务的4种视频描述方法。结果表明现有方法在处理运动表达引导的视频理解方面存在弱点和局限性。我们进一步分析了挑战并提出了一种LMPM++方法用于RVOS/AVOS/RMOT,取得了新的最先进结果。我们的数据集为复杂视频场景中运动表达引导的视频理解算法的开发提供了平台。所提出的MeViS数据集和方法源代码可在https://henghuiding.com/MeViS/公开获取。
引用
@article{arxiv.2512.10945,
title = {MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation},
author = {Henghui Ding and Chang Liu and Shuting He and Kaining Ying and Xudong Jiang and Chen Change Loy and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2512.10945},
year = {2025}
}
备注
IEEE TPAMI, Project Page: https://henghuiding.com/MeViS/