SUSD:通过状态分解实现结构化无监督技能发现
机器学习
2026-02-03 v1 人工智能
摘要
无监督技能发现(USD)旨在无需依赖外部奖励地自主学习一组多样化的技能。最常见的 USD 方法是最大化技能潜在变量与状态之间的相互信息(MI),但基于 MI 的方法倾向于偏好简单、静态技能 due to their invariance properties,这限制了对动态、任务相关行为的发现。距离最大化技能发现(DSD)通过利用状态空间距离来促进更动态的技能,但仍不足以鼓励涵盖环境中所有可控因素或实体的全面技能集合。本文我们引入 SUSD,一种新型框架,利用环境的组合结构将状态空间分解为独立组件(例如对象或可控实体)。SUSD 将不同的技能变量分配给不同的因素,从而实现对技能发现过程的更细粒度控制。一个动态模型还会跟踪各因素上的学习,适应性地引导代理人关注尚未被探索的因素。这种结构化方法不仅促进了更丰富、更多样化技能的发现,而且产生了可用于对单个实体进行细粒度、解耦控制的因子化技能表示,这有助于通过层次强化学习(HRL)高效训练分层下游任务。我们的实验结果在三个环境中进行,因子数量从 1 到 10 不等,显示我们的 метод能够在无监督情况下发现多样且复杂的技能,在因子化和复杂环境中显著优于现有的无监督技能发现方法。代码已公开:https://github.com/hadi-hosseini/SUSD。
引用
@article{arxiv.2602.01619,
title = {SUSD: Structured Unsupervised Skill Discovery through State Factorization},
author = {Seyed Mohammad Hadi Hosseini and Mahdieh Soleymani Baghshah},
journal= {arXiv preprint arXiv:2602.01619},
year = {2026}
}
备注
Accepted as a conference paper at ICLR 2026