中文

PrefPoE:基于优势引导的偏好融合学习如何探索

机器学习 2025-11-12 v1

摘要

强化学习中的探索仍是关键挑战,因为 naive 熵最大化往往导致方差高且策略更新不够高效。我们提出PrefPoE—a新颖的偏好-产品专家(PrefPoE)框架,通过首次原则性地将产品专家(PoE)融合用于单任务探索-开发平衡,实现智能、以优势为导向的探索。通过训练偏好网络将概率质量集中于高优势动作上,并通过PoE与主策略融合,PrefPoE构建了一个软信任区域,在稳定策略更新的同时保持有针对性的探索。在覆盖连续和离散动作空间的多样化控制任务中,PrefPoE展现出一致的性能提升:在HalfCheetah-v4上提升+321%(1276→5375),Ant-v4上提升+69%,LunarLander-v2上提升+276%,并在训练稳定性和样本效率方面持续优于现有方法。不同于标准PPO方法在熵崩溃问题下的困境,PrefPoE通过其独特动态维持自适应探索,从而防止早期收敛并实现卓越性能。我们的结果表明,通过优势引导的偏好学习“如何探索”与“如何行动”同等重要,为提升策略梯度方法在强化学习全领域的性能提供了通用框架。代码和预训练模型已包含在补充材料中。

关键词

引用

@article{arxiv.2511.08241,
  title  = {PrefPoE: Advantage-Guided Preference Fusion for Learning Where to Explore},
  author = {Zhihao Lin and Lin Wu and Zhen Tian and Jianglin Lan},
  journal= {arXiv preprint arXiv:2511.08241},
  year   = {2025}
}