学习什么与何处:无监督下解耦位置与身份追踪
计算机视觉与模式识别
2023-02-08 v4
摘要
我们的大脑几乎可以不费力地将视觉数据流分解为背景与显著物体。此外,它能预测物体运动与交互,这些是对概念性规划与推理至关重要的能力。近期的物体推理数据集,如 CATER,揭示了当前基于视觉的 AI 系统的根本缺陷,特别是在面向显式物体表示、物体恒存与物体推理时。在此我们引入一个自监督的位置与身份追踪系统(Loci),它在 CATER 追踪挑战上表现出色。受大脑背侧与腹侧通路启发,Loci 通过处理分离的、槽式编码的“什么”与“哪里”来解决绑定问题。Loci 类预测编码的处理鼓励主动误差最小化,使得个体槽倾向于编码个体物体。物体间交互与物体动态在解耦潜空间中处理。截断式时间反向传播结合前向资格累积显著加速学习并提升记忆效率。除了在当前基准中展现优越性能外,Loci 能有效从视频流中提取物体并将其分离为位置与格式塔成分。我们相信这种分离提供了一种将促进概念层面有效规划与推理的表示。
引用
@article{arxiv.2205.13349,
title = {Learning What and Where: Disentangling Location and Identity Tracking Without Supervision},
author = {Manuel Traub and Sebastian Otte and Tobias Menge and Matthias Karlbauer and Jannik Thümmel and Martin V. Butz},
journal= {arXiv preprint arXiv:2205.13349},
year = {2023}
}
备注
Accepted at ICLR 2023