中文

Dual-Force:基于仿真约束下的离线多样性最大化增强算法

机器学习 2025-01-09 v1 人工智能 机器人学

摘要

虽然许多针对仿真约束下多样性最大化的算法本质上是在线算法,但许多应用需要无环境交互的离线算法。面对离线设置带来的挑战,本文提出一种新型离线算法,利用基于范德维尔斯力(Van der Waals, VdW)和后继特征的目标函数增强多样性,无需学习已使用的技能判别器。此外,通过对价值函数和策略在预训练功能奖励编码(Functional Reward Encoding, FRE)上的条件化,我们的方法能更好地处理非平稳奖励,并实现对训练期遇见的所有技能的零样本回忆,显著扩展了先前工作中学习的技能集合。因此,我们的算法获得持续强劲的多样性信号(VdW),并实现更稳定、更高效的训练。我们在两个机器人任务的仿真中验证了该方法的有效性:四足动物 locomotion 以及带障碍物的局部导航。

关键词

引用

@article{arxiv.2501.04426,
  title  = {Dual-Force: Enhanced Offline Diversity Maximization under Imitation Constraints},
  author = {Pavel Kolev and Marin Vlastelica and Georg Martius},
  journal= {arXiv preprint arXiv:2501.04426},
  year   = {2025}
}