中文

VendiRL:面向多样多样性技能的自监督强化学习框架

机器学习 2025-10-14 v2 人工智能 机器人学

摘要

在自监督强化学习(RL)中,关键挑战之一是学习一组多样化的技能,以使智能体为未知的未来任务做好准备。尽管已取得显著进展,可扩展性与评估仍是普遍存在的问题。在可扩展性方面,对有意义技能的搜索可能会被高维特征空间所掩盖,其中相关特征可能因下游任务领域而异。在评估技能多样性方面,定义何为“多样性”通常需要硬性承诺一种关于技能多样性的特定概念,这可能导致对技能多样性理解的不一致,使得不同方法间的结果难以比较,且许多形式的多样性未被探索。为解决这些问题,我们采用了一种将生态学思想引入机器学习的样本多样性度量方法——Vendi Score——允许用户指定并评估任何期望的多样性形式。我们展示了该指标如何促进技能评估,并引入了 VendiRL,一个用于学习多样多样性技能集的统一框架。给定不同的相似性函数,VendiRL 能够激发不同形式的多样性,这可以在新的且具有丰富交互的环境中支持技能多样性预训练,而在这些环境中优化多种形式的多样性可能是理想的。

关键词

引用

@article{arxiv.2509.02930,
  title  = {VendiRL: A Framework for Self-Supervised Reinforcement Learning of Diversely Diverse Skills},
  author = {Erik M. Lintunen},
  journal= {arXiv preprint arXiv:2509.02930},
  year   = {2025}
}

备注

17 pages including appendices, full paper at the Scaling Environments for Agents workshop at NeurIPS 2025