中文

模拟的声音:通过生成音频学习多模态仿真-现实机器人策略

机器人学 2025-09-23 v2 计算机视觉与模式识别

摘要

机器人必须整合多种感知模态才能在现实世界中有效工作。然而,规模化地学习此类多模态策略仍具有挑战性。仿真提供了可行的解决方案,但尽管视觉受益于高保真仿真器,其他感知模态(如声音)却难以准确模拟。因此,仿真-现实迁移主要成功于基于视觉的任务,多模态迁移仍大体未实现。本文通过引入 MultiGen 框架,将大规模生成模型集成到传统物理仿真器中,实现多模态仿真,来解决上述挑战。我们在机器人倒水这一动态任务上展示了该框架,因其本质上依赖于多模态反馈。通过在仿真视频条件下合成逼真的音频,我们的方法可在无需任何真实机器人数据的情况下训练丰富的音视频轨迹。我们展示了在新容器和新液体的情况下实现有效的零样本现实倒水迁移,凸显了生成模型既能模拟难以建模的感知模态,又能缩小多模态仿真-现实鸿沟的潜力。

关键词

引用

@article{arxiv.2507.02864,
  title  = {The Sound of Simulation: Learning Multimodal Sim-to-Real Robot Policies with Generative Audio},
  author = {Renhao Wang and Haoran Geng and Tingle Li and Feishi Wang and Gopala Anumanchipalli and Trevor Darrell and Boyi Li and Pieter Abbeel and Jitendra Malik and Alexei A. Efros},
  journal= {arXiv preprint arXiv:2507.02864},
  year   = {2025}
}

备注

Conference on Robot Learning 2025