基于大规模视觉语言模型的低成本低刚度机器人日常辅助视图控制学习
机器人学
2024-03-19 v1
摘要
在本研究中,我们开发了一种简单的日常辅助机器人,能够根据语言指令控制自身的视觉。该机器人执行多项日常任务,如记录用户的面部、手部或屏幕,以及远程捕获所需位置的图像。为了构建这样的机器人,我们将预训练的大规模视觉语言模型与低成本低刚度机械臂相结合。利用神经网络概率性地学习机器人物理信息与视觉信息之间的相关性,并通过参数偏置(一种可学习的网络输入变量)来考虑基于时间和环境变化的概率分布变化。我们通过使用实际机械臂 MyCobot 进行的开放词汇视图控制实验,证明了这种学习方法的有效性。
引用
@article{arxiv.2312.07451,
title = {Daily Assistive View Control Learning of Low-Cost Low-Rigidity Robot via Large-Scale Vision-Language Model},
author = {Kento Kawaharazuka and Naoaki Kanazawa and Yoshiki Obinata and Kei Okada and Masayuki Inaba},
journal= {arXiv preprint arXiv:2312.07451},
year = {2024}
}
备注
accepted at Humanoids2023