面向终身视觉感知的具身学习
计算机视觉与模式识别
2021-12-30 v1
摘要
我们研究具身设定下的终身视觉感知,其中我们开发新模型并比较各类智能体:这些智能体在建筑物中导航,偶尔请求标注,而标注又用于精炼其视觉感知能力。智能体的目的是在结合探索与主动视觉学习的过程结束时,识别整栋建筑中的物体及其他语义类别。由于我们在终身学习背景下研究该任务,智能体应利用在先前访问环境中获得的知识,以指导其在后续访问建筑中的探索和主动学习策略。我们使用语义分割性能作为通用视觉感知的替代指标,并针对多种探索与标注方法研究这一新任务,从使用启发式主动学习的边界探索基线,到完全可学习的方法。对于后者,我们引入一种基于深度强化学习(RL)的智能体,其联合学习导航与主动学习。将点目标导航公式与提供目标的全局规划器集成到RL模型中,以进一步激励对新场景的系统性探索。通过在Matterport3D数据集上进行大量实验,我们展示了所提智能体如何在探索新场景时利用已探索场景的知识,例如通过更粗粒度的探索和更少的标注请求。结果还表明,基于学习的智能体比启发式替代方案能更有效地利用其先前的视觉知识。
引用
@article{arxiv.2112.14084,
title = {Embodied Learning for Lifelong Visual Perception},
author = {David Nilsson and Aleksis Pirinen and Erik Gärtner and Cristian Sminchisescu},
journal= {arXiv preprint arXiv:2112.14084},
year = {2021}
}