离线强化学习中的基于策略的轨迹聚类
机器学习
2025-06-13 v2 人工智能
摘要
我们提出了一种从离线强化学习(RL)数据集中对轨迹进行聚类的新任务,其中每个聚类中心代表生成其轨迹的策略。通过利用离线轨迹分布的KL散度与策略诱导分布混合之间的联系,我们构建了一个自然的聚类目标。为解决此问题,我们提出了基于策略的K均值(PG-Kmeans)和质心吸引自编码器(CAAE)。PG-Kmeans迭代地训练行为克隆(BC)策略并根据策略生成概率分配轨迹,而CAAE类似于VQ-VAE框架,通过引导轨迹的潜在表示向特定码本条目附近移动来实现聚类。理论上,我们证明了PG-Kmeans的有限步收敛,并识别出离线轨迹聚类中的一个关键挑战:由于策略诱导的冲突导致最优解的内在模糊性,这可能导致多个同等有效但结构不同的聚类。实验上,我们在广泛使用的D4RL数据集和自定义GridWorld环境中验证了我们的方法。结果表明PG-Kmeans和CAAE都能有效地将轨迹划分为有意义的聚类。它们为基于策略的轨迹聚类提供了一个有前景的框架,在离线RL及更广泛的领域具有广泛应用。
引用
@article{arxiv.2506.09202,
title = {Policy-Based Trajectory Clustering in Offline Reinforcement Learning},
author = {Hao Hu and Xinqi Wang and Simon Shaolei Du},
journal= {arXiv preprint arXiv:2506.09202},
year = {2025}
}