视频多目标系统识别
计算机视觉与模式识别
2026-03-09 v1
摘要
我们提出了从视频中进行多目标系统识别的新颖问题,现有方法由于侧重于单目标场景或带有固定原型集的离散材料分类,难以适用。为此,我们提出了MOSIV框架,直接优化视频中每个对象的连续材料参数,该框架利用由视频几何目标引导的可微仿真器。我们还present了一个新的合成基准,包含接触丰富的多目标相互作用,以便于评估。在该基准上,MOSIV在 grounding 准确性和长期仿真保真度方面显著优于改编的基线方法,建立了该新任务的强基线。我们的分析表明,对象级别的细粒度监督和几何对齐目标对于在这些复杂的多目标设置中实现稳定优化至关重要。该项目的源代码和数据集将对外公开。
引用
@article{arxiv.2603.06022,
title = {MOSIV: Multi-Object System Identification from Videos},
author = {Chunjiang Liu and Xiaoyuan Wang and Qingran Lin and Albert Xiao and Haoyu Chen and Shizheng Wen and Hao Zhang and Lu Qi and Ming-Hsuan Yang and Laszlo A. Jeni and Min Xu and Yizhou Zhao},
journal= {arXiv preprint arXiv:2603.06022},
year = {2026}
}
备注
ICLR 2026