MaskCaptioner:学习在视频中联合分割和描述物体轨迹
计算机视觉与模式识别
2025-10-31 v2 人工智能
机器学习
摘要
稠密视频物体描述(DVOC)是联合检测、跟踪和描述视频中物体轨迹的任务,需要理解时空细节并以自然语言描述它们。由于任务的复杂性以及手动标注的高成本,先前的方法采用离散的训练策略,可能导致次优性能。为规避此问题,我们提出利用最先进的视觉语言模型(VLM)生成关于时空局部化实体的描述。通过我们为 LVIS 和 LV-VIS 数据集添加合成描述(LVISCap 和 LV-VISCap),我们训练了 MaskCaptioner——一个能够联合检测、分割、跟踪和描述物体轨迹的端到端模型。此外,基于 LVISCap 和 LV-VISCap 的预训练,MaskCaptioner 在三个现有基准测试(VidSTG、VLN 和 BenSMOT)上实现了 DVOC 的最先进结果。数据集和代码均可在 https://www.gabriel.fiastre.fr/maskcaptioner/ 获取。
引用
@article{arxiv.2510.14904,
title = {MaskCaptioner: Learning to Jointly Segment and Caption Object Trajectories in Videos},
author = {Gabriel Fiastre and Antoine Yang and Cordelia Schmid},
journal= {arXiv preprint arXiv:2510.14904},
year = {2025}
}
备注
20 pages, 8 figures