Dual-Force:基于仿真约束下的离线多样性最大化增强算法
机器学习
2025-01-09 v1 人工智能
机器人学
摘要
虽然许多针对仿真约束下多样性最大化的算法本质上是在线算法,但许多应用需要无环境交互的离线算法。面对离线设置带来的挑战,本文提出一种新型离线算法,利用基于范德维尔斯力(Van der Waals, VdW)和后继特征的目标函数增强多样性,无需学习已使用的技能判别器。此外,通过对价值函数和策略在预训练功能奖励编码(Functional Reward Encoding, FRE)上的条件化,我们的方法能更好地处理非平稳奖励,并实现对训练期遇见的所有技能的零样本回忆,显著扩展了先前工作中学习的技能集合。因此,我们的算法获得持续强劲的多样性信号(VdW),并实现更稳定、更高效的训练。我们在两个机器人任务的仿真中验证了该方法的有效性:四足动物 locomotion 以及带障碍物的局部导航。
引用
@article{arxiv.2501.04426,
title = {Dual-Force: Enhanced Offline Diversity Maximization under Imitation Constraints},
author = {Pavel Kolev and Marin Vlastelica and Georg Martius},
journal= {arXiv preprint arXiv:2501.04426},
year = {2025}
}