基于 VQVAE 与模糊聚类的离线强化学习高效抗探索方法
机器学习
2026-02-10 v1
摘要
伪计数是离线强化学习(RL)中有效的抗探索方法,通过计数状态-动作对并对稀有或未出现的状态-动作对数据施加大幅惩罚。现有的抗探索方法通过离散化连续状态-动作对来计数,但常因离散化过程中的维度灾难和信息损失问题,导致效率和性能下降,甚至引发策略学习失败。在本文中,提出了一种基于向量量化变分自编码器(VQVAE)和模糊聚类的新颖抗探索方法。我们首先提出了一种基于多码本 VQVAE 的高效伪计数方法,对状态-动作对进行离散化,并设计了一种基于所提伪计数方法的离线 RL 抗开发方法,以处理维度灾难问题并提高学习效率。此外,发展了一种基于模糊 C 均数(FCM)聚类的码本更新机制,以提高码本中向量的利用率,从而解决离散化过程中信息损失的问题。对所提方法在深度数据驱动强化学习数据集(D4RL)上的评估表明,与最先进(SOTA)方法相比,在多个复杂任务中,所提方法性能更好且计算成本更低。
引用
@article{arxiv.2602.07889,
title = {Efficient Anti-exploration via VQVAE and Fuzzy Clustering in Offline Reinforcement Learning},
author = {Long Chen and Yinkui Liu and Shen Li and Bo Tang and Xuemin Hu},
journal= {arXiv preprint arXiv:2602.07889},
year = {2026}
}