从视频中学习社会示能语法:将人类交互迁移至人机交互
机器人学
2017-03-03 v1 人工智能
计算机视觉与模式识别
摘要
本文提出了一种通用框架,用于从人类交互的 RGB-D 视频中学习作为时空与 - 或图 (ST-AOG) 的社会示能语法,并将该语法迁移到人形机器人,以实现人机交互 (HRI) 的实时运动推断。基于 Gibbs 采样,我们的弱监督语法学习能够自动构建交互的层次化表示,涵盖两个智能体的长期联合子任务以及单个智能体的短期原子动作。基于一个包含丰富人类交互实例的新 RGB-D 视频数据集,我们在 Baxter 仿真、人类评估及真实 Baxter 测试中的实验表明,从有限训练数据中学得的模型能够在未见场景中成功生成类人行为,且性能优于基线方法。
引用
@article{arxiv.1703.00503,
title = {Learning Social Affordance Grammar from Videos: Transferring Human Interactions to Human-Robot Interactions},
author = {Tianmin Shu and Xiaofeng Gao and Michael S. Ryoo and Song-Chun Zhu},
journal= {arXiv preprint arXiv:1703.00503},
year = {2017}
}
备注
The 2017 IEEE International Conference on Robotics and Automation (ICRA)