基于条件自回归归纳偏置的对象中心时间一致性
计算机视觉与模式识别
2024-10-22 v1 机器学习
摘要
从视频中进行无监督对象中心学习是一种有前景的ethods,以学习可应用于各种下游任务(如预测和推理)的组合表示。最近的研究表明,预训练的视觉Transformer(ViT)可用于在真实世界视频数据集上学习对象中心表示。然而,尽管这些方法在从场景中提取对象方面取得成功,基于槽位的表示在视频连续帧之间未能维持时间一致性,即对象到槽位的映射在视频中变化。为此,我们引入条件自回归槽注意(CA-SA),一个增强提取对象中心表示在视频导向视觉任务中时间一致性的框架。利用自回归先验网络对表示进行条件化以依赖于前导时间步,以及一种新颖的一致性损失函数,CA-SA预测未来槽位表示并在帧之间施加一致性。我们呈现了定性和量化结果,表明我们提出的方法在下游任务(如视频预测和视觉问答任务)上优于所考虑的基线。
关键词
引用
@article{arxiv.2410.15728,
title = {Object-Centric Temporal Consistency via Conditional Autoregressive Inductive Biases},
author = {Cristian Meo and Akihiro Nakano and Mircea Lică and Aniket Didolkar and Masahiro Suzuki and Anirudh Goyal and Mengmi Zhang and Justin Dauwels and Yutaka Matsuo and Yoshua Bengio},
journal= {arXiv preprint arXiv:2410.15728},
year = {2024}
}