中文

通过在强化学习期间对奖励函数进行主动突变实现机器人技能多样化——基于液体倒灌任务

机器人学 2025-09-24 v1 机器学习

摘要

本文探讨了如何通过对强化学习中的奖励函数进行刻意突变,以产生机器人操作任务中的技能多样化变体,研究对象为液体倒灌用例。为此,我们开发了一种基于对奖励函数中不同术语权重施加高斯噪声的奖励函数突变框架。灵感来自人类运动控制中的成本-收益权衡模型,我们设计了包含以下关键术语的奖励函数:准确性、时间和 effort。该研究在 NVIDIA Isaac Sim 中创建的仿真环境中进行,包括 Franka Emika Panda 机器人臂握持装有液体的玻璃杯倒灌至容器中。强化学习算法基于近端策略优化 (PPO)。我们系统地探索了不同配置的突变奖励权重对所学策略的影响。所得策略表现出广泛的行为:从对原本计划的倒灌任务执行方式的变体到对意外任务有益的新技能,如容器边缘清洁、液体混合和浇水。该方法为机器人系统在特定任务上进行多样化学习提供了有前景的方向,同时也可能派生出针对未来任务的有意义技能。

关键词

引用

@article{arxiv.2509.18463,
  title  = {Robotic Skill Diversification via Active Mutation of Reward Functions in Reinforcement Learning During a Liquid Pouring Task},
  author = {Jannick van Buuren and Roberto Giglio and Loris Roveda and Luka Peternel},
  journal= {arXiv preprint arXiv:2509.18463},
  year   = {2025}
}