从恶性循环到善性循环:基于无监督视频对象中心学习的协同表征学习
计算机视觉与模式识别
2026-02-04 v1 机器学习
摘要
无监督对象中心学习模型,特别是基于插槽的架构,在分解复杂场景方面显示出巨大的潜力。然而,这些模型依赖于基于重构的训练,导致编码器的锐利、高频注意力图与解码器的空间一致但模糊的重构图之间存在根本性冲突。我们识别到这一差异导致恶性循环:编码器的噪声特征图迫使解码器在可能性上进行平均,产生更模糊的输出,而从模糊的重构图计算的梯度缺乏必要的高频细节来监督编码器特征。为打破这一循环,我们引入协同表征学习 (SRL),在编码器和解码器之间建立善性循环。SRL 利用编码器的锐度来去模糊解码器输出中的语义边界,同时利用解码器的空间一致性来去噪编码器的特征。通过桥接编码器和解码器之间的表征差距,SRL 在视频对象中心学习基准测试上实现了最先进的成绩。代码可在 https://github.com/hynnsk/SRL 获取。
引用
@article{arxiv.2602.03390,
title = {From Vicious to Virtuous Cycles: Synergistic Representation Learning for Unsupervised Video Object-Centric Learning},
author = {Hyun Seok Seong and WonJun Moon and Jae-Pil Heo},
journal= {arXiv preprint arXiv:2602.03390},
year = {2026}
}
备注
ICLR 2026; Code is available at https://github.com/hynnsk/SRL