PANDORA: 灵巧机器人钢琴演奏的扩散策略学习
机器学习
2025-03-20 v1 机器人学
声音
音频与语音处理
摘要
我们提出了PANDORA,一个专为灵巧机器人钢琴演奏设计的新型基于扩散的策略学习框架。我们的方法采用带有FiLM全局条件增强的条件U-Net架构,该架构迭代地将噪声动作序列去噪为平滑的高维轨迹。为了实现精确的按键执行并结合富有表现力的音乐表现力,我们设计了一个复合奖励函数,整合了任务特定的准确性、音频保真度以及来自大语言模型(LLM)神谕的高层语义反馈。LLM神谕评估音乐表现力和风格细微差别,从而实现动态的、针对手部的奖励调整。进一步由残差逆运动学细化策略增强,PANDORA在ROBOPIANIST环境中达到了最先进的性能,在精确性和表现力方面均显著优于基线。消融研究验证了基于扩散的去噪和LLM驱动的语义反馈在提升机器人音乐性方面的关键贡献。视频链接: https://taco-group.github.io/PANDORA
引用
@article{arxiv.2503.14545,
title = {PANDORA: Diffusion Policy Learning for Dexterous Robotic Piano Playing},
author = {Yanjia Huang and Renjie Li and Zhengzhong Tu},
journal= {arXiv preprint arXiv:2503.14545},
year = {2025}
}