中文

基于无标签和不完整数据的自编码器专家混合指导在强化学习中的探索

机器学习 2025-07-22 v1 人工智能

摘要

近期强化学习(RL)趋势凸显了代理人需从奖励免费的交互和替代监督信号(如无标签或不完整演示)学习,而非仅依赖显式奖励最大化。此外,开发能够在真实环境中高效适应的通用代理人往往需要利用这些奖励免费的信号来指导学习和行为。然而,尽管内在动机技术为代理人在缺乏显式奖励时寻找出新或不确定状态提供了可能,但往往面临稠密奖励环境或高维状态与动作空间的复杂性挑战。此外,大多数现有方法直接依赖未加工的内在奖励信号,这会使难以塑形或控制代理人的探索。我们提出了一个框架,能够有效利用即使不完整和不完美的专家演示。通过将代理人状态与专家数据相似性的映射函数转化为塑形后的内在奖励,我们的方法允许对专家式行为进行灵活且有针对性的探索。我们采用自编码器专家混合捕获多样化行为,容纳演示中的缺失信息。实验表明,我们的方法在稀疏和稠密奖励环境中实现稳健的探索和卓越的性能,即使演示稀疏或不完整亦可如此。这为数据不可用且需要精确奖励控制的真实世界 RL 提供了实用框架。

关键词

引用

@article{arxiv.2507.15287,
  title  = {Mixture of Autoencoder Experts Guidance using Unlabeled and Incomplete Data for Exploration in Reinforcement Learning},
  author = {Elias Malomgré and Pieter Simoens},
  journal= {arXiv preprint arXiv:2507.15287},
  year   = {2025}
}

备注

10 pages, 8 figures, accepted for the non-archival workshop "Workshop on Reinforcement Learning Beyond Rewards @ Reinforcement Learning Conference 2025"