重建引导的插槽课程:解决视频对象中心学习中的对象过度碎片化问题
计算机视觉与模式识别
2026-03-25 v1 机器学习
摘要
视频对象中心学习旨在将原始视频分解为少数对象槽位,但现有的注意力槽模型常 suffer于严重的过度碎片化。这是因为模型在隐式地被鼓励占用所有槽位以最小化重建目标,从而导致单个对象用多个冗余槽位表示。我们通过重建引导的槽位课程(SlotCurri)来解决这一局限。训练开始时仅使用少数粗糙槽位,然后在重建误差保持较高的地方逐步分配新的槽位,从而在需要的地方仅扩展容量,防止碎片化问题的发生。然而,在槽位扩展期间,只有当粗糙层次的语义已经很好地分离时,才能出现有意义的子部分;但由于初始槽位预算有限且采用均方误差(MSE)目标,语义边界保持模糊。因此,我们在MSE上增添结构感知损失,以保留局部对比和边缘信息,以鼓励每个槽位 Sharpen 其语义边界。最后,我们提出一种循环推理,使槽位沿帧序列向前再向后滚动,产生即使在最早的帧中也具有时序一致性的对象表示。综合所有措施,SlotCurri通过在重建失败的地方分配表示容量来解决对象过度碎片化问题,并通过结构线索和循环推理进一步增强。在YouTube-VIS和MOVi-C上分别实现FG-ARI提升+6.8和+8.3,验证了SlotCurri的有效性。我们的代码可在github.com/wjun0830/SlotCurri获取。
引用
@article{arxiv.2603.22758,
title = {Reconstruction-Guided Slot Curriculum: Addressing Object Over-Fragmentation in Video Object-Centric Learning},
author = {WonJun Moon and Hyun Seok Seong and Jae-Pil Heo},
journal= {arXiv preprint arXiv:2603.22758},
year = {2026}
}
备注
CVPR 2026 paper. Our code is available at github.com/wjun0830/SlotCurri