在线推理视频目标分割
计算机视觉与模式识别
2026-04-14 v1
摘要
推理视频目标分割根据自然语言查询预测视频中的像素级掩码,这些查询可能涉及隐含的和时间上接地(temporally grounded)的指代。然而,现有方法是在离线模式下开发和评估的,其中整个视频在推理时可用,并且可以利用未来帧进行回顾性消歧,这偏离了需要严格因果、逐帧决策的真实世界部署。我们研究在线推理视频目标分割(ORVOS),其中模型必须仅使用过去和当前帧逐步解释查询,而不重新审视先前的预测,同时处理随着事件展开的指代对象转移。为了支持评估,我们引入了ORVOSB,一个具有帧级因果标注和指代对象转移标签的基准,包含210个视频、12907个标注帧和涵盖五个推理类别的512个查询。我们进一步提出了一个基线,该基线具有持续更新的分割提示和结构化的时间词元库,用于在有界计算下进行长程推理。实验表明,现有方法在严格因果性和指代对象转移下表现不佳,而我们的基线为未来研究奠定了坚实基础。
引用
@article{arxiv.2604.11411,
title = {Online Reasoning Video Object Segmentation},
author = {Jinyuan Liu and Yang Wang and Zeyu Zhao and Weixin Li and Song Wang and Ruize Han},
journal= {arXiv preprint arXiv:2604.11411},
year = {2026}
}