基于时序最优传输奖励的机器人策略学习
人工智能
2024-11-05 v2 机器学习
机器人学
摘要
奖励设定是强化学习中最棘手的问题之一,在实践中通常需要繁琐的手工工程。解决这一挑战的一个有前景的方法是采用现有的专家视频演示进行策略学习。最近的一些工作研究了如何仅从单个或少数几个专家视频演示中学习机器人策略。例如,通过最优传输(OT)进行奖励标记已被证明是一种有效的策略,通过测量机器人轨迹与专家演示之间的对齐程度来生成代理奖励。然而,先前的工作大多忽略了 OT 奖励对时序顺序信息的不变性,这可能会给奖励信号带来额外的噪声。为了解决这个问题,在本文中,我们引入了时序最优传输(TemporalOT)奖励,以结合时序顺序信息来学习更准确的基于 OT 的代理奖励。在 Meta-world 基准任务上的大量实验验证了所提方法的有效性。代码可在 https://github.com/fuyw/TemporalOT 获取。
引用
@article{arxiv.2410.21795,
title = {Robot Policy Learning with Temporal Optimal Transport Reward},
author = {Yuwei Fu and Haichao Zhang and Di Wu and Wei Xu and Benoit Boulet},
journal= {arXiv preprint arXiv:2410.21795},
year = {2024}
}
备注
NeurIPS 2024