具身智能体多感官前瞻框架
机器人学
2021-09-17 v1 计算机视觉与模式识别
摘要
预测未来感官状态对于机器人、无人机和自动驾驶车辆等学习智能体至关重要。本文将多种感官模态与探索性动作相耦合,并提出一种预测性神经网络架构以解决该问题。大多数现有方法依赖大型人工标注数据集,或仅使用视觉数据作为单一模态。相比之下,本文提出的无监督方法利用多模态感知来预测未来视觉帧。因此,所提模型更为全面,能更好地捕捉环境的时空动态,从而实现更精确的视觉帧预测。我们框架的另一新颖之处在于使用专用子网络来预测未来的触觉、音频与触觉信号。该框架在一个包含 4 种感官模态(视觉、触觉、音频与触觉)的数据集上进行了测试与验证,该数据集由人形机器人在大量物体上多次执行 9 种行为得到。尽管视觉信息为主导模态,利用额外的非视觉模态提升了预测精度。
引用
@article{arxiv.2109.07561,
title = {A Framework for Multisensory Foresight for Embodied Agents},
author = {Xiaohui Chen and Ramtin Hosseini and Karen Panetta and Jivko Sinapov},
journal= {arXiv preprint arXiv:2109.07561},
year = {2021}
}
备注
ICRA 2021