中文

可控多样化行为的离线学习

机器学习 2025-04-28 v1 人工智能 机器人学

摘要

模仿学习(IL)技术旨在复制特定任务中的人类行为。虽然 IL 因其有效性和效率而广受欢迎,但传统方法通常 focuses on 从专家收集的数据集中产生单一高效策略。最近提出的扩展方法主要 focus on 在学习转换级别的多样化策略或在轨迹级别执行熵最大化。虽然这些方法可能导致多样化的行为,但可能不足以再现示范的实际多样性或允许受控的轨迹生成。为克服这些缺陷,我们提出一种不同的方法,基于两个关键特征:a)时间一致性确保整个剧集中的行为一致,而不仅仅是在转换级别;b)可控性通过构建行为的潜在空间来实现,允许用户根据自己的要求选择性激活特定的行为。我们将我们的方案与一套多样化的任务和环境中的最先进方法进行比较。项目页面:https://mathieu-petitbois.github.io/projects/swr/

关键词

引用

@article{arxiv.2504.18160,
  title  = {Offline Learning of Controllable Diverse Behaviors},
  author = {Mathieu Petitbois and Rémy Portelas and Sylvain Lamprier and Ludovic Denoyer},
  journal= {arXiv preprint arXiv:2504.18160},
  year   = {2025}
}

备注

Generative Models for Robot Learning Workshop at ICLR 2025