中文

通过潜在想象从视频中学习物体恒存性

计算机视觉与模式识别 2024-04-12 v2

摘要

尽管人类婴儿从两个月大起就表现出关于物体恒存性的知识,深度学习方法在很大程度上仍无法识别物体的持续存在。我们引入一种基于槽的自回归深度学习系统——循环位置与身份追踪模型 Loci-Looped,它学习将潜在想象与像素空间观测自适应融合为随时间一致的、物体特定的潜在 what 与 where 编码。这一新颖的循环使 Loci-Looped 仅通过观测即可学习物体恒存性、方向惯性与物体实体性等物理概念。因此,Loci-Looped 能在遮挡中追踪物体、预测其重现,并在观察到不合理物体行为时表现出惊讶与内部修正。值得注意的是,Loci-Looped 在处理物体遮挡与暂时性感官中断方面优于 state-of-the-art 基线模型,同时展现出更具组合性、可解释的內部活动模式。因此,我们的工作引入了首个直接从视频数据中无监督学习物体恒存性的自监督可解释学习模型。

关键词

引用

@article{arxiv.2310.10372,
  title  = {Learning Object Permanence from Videos via Latent Imaginations},
  author = {Manuel Traub and Frederic Becker and Sebastian Otte and Martin V. Butz},
  journal= {arXiv preprint arXiv:2310.10372},
  year   = {2024}
}