中文

从技能进行任务适应:信息几何、解耦合及无监督强化学习中的新目标

机器学习 2025-06-13 v1 人工智能 信息论 math.IT

摘要

无监督强化学习(URL)旨在学习适用于未来下游任务的通用技能。互信息技能学习(MISL)通过最大化状态与技能之间的互信息来解决URL问题,但缺乏充分的理论分析,例如所学习技能多好地能初始化下游任务的策略。我们在本文中对MISL进行新的理论分析,表明所学习技能的多样性和可分离性在下游任务适应中至关重要,但MISL并不一定保证这些属性。为补充MISL,我们提出了一种新的解耦合度度量LSEPIN。此外,我们在LSEPIN与下游任务适应成本之间建立了信息几何联系。为更好的几何属性,我们研究了一种将信息几何中的 KL 散度替换为 Wasserstein 距离的新策略。我们将几何分析推广至该距离度量,导致一种新的技能学习目标WSEP。理论上,WSEP有助于下游任务适应,并且能够发现比MISL更多的下游任务初始策略。我们最终提出另一种基于 Wasserstein 距离的算法PWSEP,可在理论上发现所有最优初始策略。

关键词

引用

@article{arxiv.2506.10629,
  title  = {Task Adaptation from Skills: Information Geometry, Disentanglement, and New Objectives for Unsupervised Reinforcement Learning},
  author = {Yucheng Yang and Tianyi Zhou and Qiang He and Lei Han and Mykola Pechenizkiy and Meng Fang},
  journal= {arXiv preprint arXiv:2506.10629},
  year   = {2025}
}

备注

Spotlight paper at ICLR 2024. This version includes acknowledgments omitted from the ICLR version and indicates the corresponding authors primarily responsible for the work