那听起来是对的:面向动态机器人操作的听觉自监督
机器人学
2022-10-04 v1 机器学习
声音
音频与语音处理
摘要
从原始感官数据中学习产生富含接触、动态的行为一直是机器人领域的长期挑战。主流方法主要聚焦于使用视觉或触觉传感,遗憾的是前者无法捕捉高频交互,而后者在大规模数据收集时可能过于脆弱。在本工作中,我们提出一种以数据为中心的动态操作方法,利用一种常被忽视的信息源:声音。我们首先使用商用接触式麦克风在五项动态任务上收集了 25k 个交互-声音对的数据集。随后,给定该数据,我们利用自监督学习来加速从声音进行行为预测。我们的实验表明,这种自监督“预训练”对实现高性能至关重要,其 MSE 比普通监督学习低 34.5%,比视觉训练低 54.3%。重要的是,我们发现当被要求生成期望的声音轮廓时,我们的模型在 UR10 机器人上的在线滚动输出能够产生动态行为,在音频相似度指标上平均比监督学习提升 11.5%。
引用
@article{arxiv.2210.01116,
title = {That Sounds Right: Auditory Self-Supervision for Dynamic Robot Manipulation},
author = {Abitha Thankaraj and Lerrel Pinto},
journal= {arXiv preprint arXiv:2210.01116},
year = {2022}
}
备注
Videos and audio data are best seen on our project website: audio-robot-learning.github.io