用于语音控制机器人的视觉-音频表征学习
机器人学
2023-03-07 v3 人工智能
摘要
基于表征学习的最新进展,我们提出了一种面向任务的语音控制机器人新流水线,该流水线以原始传感器输入作为输入。先前的方法依赖大量标签和特定任务的奖励函数。这种方法不仅在部署后难以改进,而且在不同机器人平台和任务之间的泛化能力有限。为了解决这些问题,我们的流水线首先学习一种将图像和声音指令相关联的视觉-音频表征(VAR)。然后,机器人利用 VAR 生成的奖励,通过强化学习来执行声音指令。我们用多种声音类型、机器人和任务演示了我们的方法。我们表明,我们的方法以少得多的标签优于先前的工作。我们在模拟和真实世界实验中均表明,在给定合理数量的新标注数据的情况下,该系统能够在先前未见过的场景中自我改进。
引用
@article{arxiv.2109.02823,
title = {Learning Visual-Audio Representations for Voice-Controlled Robots},
author = {Peixin Chang and Shuijing Liu and D. Livingston McPherson and Katherine Driggs-Campbell},
journal= {arXiv preprint arXiv:2109.02823},
year = {2023}
}
备注
Published in ICRA 2023