中文

PANDORA: 灵巧机器人钢琴演奏的扩散策略学习

机器学习 2025-03-20 v1 机器人学 声音 音频与语音处理

摘要

我们提出了PANDORA,一个专为灵巧机器人钢琴演奏设计的新型基于扩散的策略学习框架。我们的方法采用带有FiLM全局条件增强的条件U-Net架构,该架构迭代地将噪声动作序列去噪为平滑的高维轨迹。为了实现精确的按键执行并结合富有表现力的音乐表现力,我们设计了一个复合奖励函数,整合了任务特定的准确性、音频保真度以及来自大语言模型(LLM)神谕的高层语义反馈。LLM神谕评估音乐表现力和风格细微差别,从而实现动态的、针对手部的奖励调整。进一步由残差逆运动学细化策略增强,PANDORA在ROBOPIANIST环境中达到了最先进的性能,在精确性和表现力方面均显著优于基线。消融研究验证了基于扩散的去噪和LLM驱动的语义反馈在提升机器人音乐性方面的关键贡献。视频链接: https://taco-group.github.io/PANDORA

关键词

引用

@article{arxiv.2503.14545,
  title  = {PANDORA: Diffusion Policy Learning for Dexterous Robotic Piano Playing},
  author = {Yanjia Huang and Renjie Li and Zhengzhong Tu},
  journal= {arXiv preprint arXiv:2503.14545},
  year   = {2025}
}