面向机器人的交互式视觉任务学习
机器人学
2023-12-21 v1 计算与语言
计算机视觉与模式识别
摘要
我们提出了一个框架,使机器人能够通过与人类用户的现场语言交互来学习新的视觉概念和任务。以往的方法要么使用大型预训练视觉模型来零样本推断新物体,要么将新概念及其属性和表示添加到概念层次结构中。我们扩展了专注于学习视觉概念层次结构的方法,使其能够学习新概念并用其解决未见过的机器人任务。为了使视觉概念学习器能够单样本解决机器人任务,我们开发了两种不同的技术。首先,我们提出了一种新方法 Hi-Viscont(用于任务的层次化视觉概念学习器,HIerarchical VISual CONcept learner for Task),将新概念的信息增强到概念层次结构中的其父节点。这种信息传播允许层次结构中的所有概念在持续学习环境中随着新概念的教授而更新。其次,我们将视觉任务表示为带有语言注释的场景图,使我们能够在现场零样本创建已演示任务的新排列。我们展示了两组结果。首先,我们在三个领域将 Hi-Viscont 与基线模型(FALCON)在视觉问答(VQA)上进行了比较。在叶级概念上与基线模型相当的同时,Hi-Viscont 在非叶级概念上平均实现了超过 9% 的提升。我们将模型的性能与基线 FALCON 模型进行了比较。我们的框架在成功率指标上实现了 33% 的提升,在物体级准确率上实现了 19% 的提升。通过这两项结果,我们证明了我们的模型在机器人上具有在持续学习环境中学习任务和概念的能力。
引用
@article{arxiv.2312.13219,
title = {Interactive Visual Task Learning for Robots},
author = {Weiwei Gu and Anant Sah and Nakul Gopalan},
journal= {arXiv preprint arXiv:2312.13219},
year = {2023}
}
备注
In Proceedings of The 38th Annual AAAI Conference on Artificial Intelligence