基于视觉语言模型与本体系统从视频流中理解机器人与人类操作任务的情境
计算机视觉与模式识别
2020-03-04 v1 机器人学
摘要
日常生活中的操作任务,如倒水,是在特定的操作情境下有意展开的。能够随时间处理这些日常生活活动(ADLs)中的情境知识,有助于我们理解操作意图,而这对于智能机器人在各种操作动作之间平滑过渡至关重要。本文为机器人与人类操作在一个严格受限的知识域内提出了一个视觉数据集,其中操作概念与关系以分类方式由本体系统存储。此外,我们提出了一种方案,用于生成视觉注意力组合与填充了常识知识的演化知识图。我们的方案作用于真实世界摄像头流,并将基于注意力的视觉语言模型与本体系统相融合。实验结果表明,所提方案能够成功表示机器人与人类预期物体操作过程的演化。该方案使机器人能够通过观看实时视频来模仿类人的有意行为。我们旨在进一步发展该方案,以用于人机交互中的真实世界机器人智能。
引用
@article{arxiv.2003.01163,
title = {Understanding Contexts Inside Robot and Human Manipulation Tasks through a Vision-Language Model and Ontology System in a Video Stream},
author = {Chen Jiang and Masood Dehghan and Martin Jagersand},
journal= {arXiv preprint arXiv:2003.01163},
year = {2020}
}