中文

ComSD:在无监督技能发现中平衡行为质量与多样性

机器学习 2025-02-25 v3 人工智能 机器人学

摘要

本工作已提交至IEEE以备可能发表。版权可能在未通知的情况下转让,此后该版本可能不再可访问。无监督技能发现旨在通过无监督强化学习(RL)在没有外在奖励的情况下获取不同的有用技能,所发现的技能能以多种方式高效适应多个下游任务。然而,近期先进的技能发现方法难以很好地平衡状态探索与技能多样性,尤其在潜在技能丰富且难以区分时。本文中,我们提出\textbf{对}\textbf{比}\textbf{动}\textbf{态}\textbf{技}\textbf{能}\textbf{发}\textbf{现}\textbf{(ComSD)}\footnote{代码与视频:https://github.com/liuxin0824/ComSD},其通过一种新颖的内在激励——对比动态奖励——生成多样且具探索性的无监督技能。它包含基于粒子的探索奖励以使智能体到达远距离状态从而获取探索性技能,以及一种新颖的对比多样性奖励以提升不同技能间的可区分性。此外,提出上述两种奖励间的一种新颖动态加权机制以平衡状态探索与技能多样性,进一步提升了所发现技能的质量。大量实验与分析表明,ComSD能为多关节机器人生成不同探索层级的多样行为,在具挑战性的下游任务上实现最先进的适应性能。它还能在具挑战性的树状2D迷宫中发现可区分且远距离的探索技能。

关键词

引用

@article{arxiv.2309.17203,
  title  = {ComSD: Balancing Behavioral Quality and Diversity in Unsupervised Skill Discovery},
  author = {Xin Liu and Yaran Chen and Dongbin Zhao},
  journal= {arXiv preprint arXiv:2309.17203},
  year   = {2025}
}

备注

This work has been submitted to the IEEE for possible publication. Current title: Balancing State Exploration and Skill Diversity in Unsupervised Skill Discovery