通过主动推断解耦三维以对象为中心的表征中的“是什么”与“在哪里”
人工智能
2021-08-27 v1
摘要
尽管现代目标检测与分类模型取得了很高的准确率,但它们通常预先在固定的训练集上受约束,因此难以灵活处理新颖的、未见过的对象类别。此外,这些模型大多在单帧上运行,在视角模糊的情况下可能产生错误的分类。本文提出一种主动推断智能体,它主动收集用于对象分类的证据,并能够随时间学习新颖的对象类别。受人类大脑启发,我们构建了以对象为中心的生成模型,该模型由两条信息流组成:一条“是什么”流和一条“在哪里”流。“是什么”流预测所观察对象是否属于特定类别,而“在哪里”流负责在其内部三维参考系中表示该对象。我们表明,我们的智能体 (i) 能够以无监督方式学习许多对象类别的表征,(ii) 达到最先进的分类准确率,并在需要时主动消除歧义,以及 (iii) 识别新颖的对象类别。此外,我们以端到端方式验证我们的系统,其中智能体能够从基于像素的渲染中搜索给定姿态下的对象。我们认为,这是构建可用于涉及三维对象的广泛任务的模块化智能系统的第一步。
引用
@article{arxiv.2108.11762,
title = {Disentangling What and Where for 3D Object-Centric Representations Through Active Inference},
author = {Toon Van de Maele and Tim Verbelen and Ozan Catal and Bart Dhoedt},
journal= {arXiv preprint arXiv:2108.11762},
year = {2021}
}