行为一致的深度强化学习
机器学习
2026-05-22 v2 人工智能
摘要
强化学习 (RL) 往往在不同训练运行之间表现出高方差,导致性能不可靠,成为在实际领域部署的主要挑战。本文通过形式化化解跨运行策略发散的问题,提出行为一致 RL,其中目标是获得在训练运行之间具有高性能且分布相似的策略。我们的关键观察是,最大熵 RL 提供了一种直接控制行为发散的机制,通过将运行锚定到常见 (均匀) 先验来实现。我们证明了对于布尔政策,选择温度与 Q 函数不一致性成比例,可界定诱导策略之间的两两 KL 发散。然而,我们也表明,单纯增加熵可能会损害策略优化的同时放大离策略误差。基于这些观察,我们提出 Q 值期望不平等 (QED),一种基于双评论家不一致性作为单运行代理用于跨运行不一致性的状态依赖温度方案。经验上,我们在 18 个连续控制任务上展示,QED 在不牺牲性能的情况下,将跨运行发散降低了两个数量级,显著降低了回报方差,同时以适度的样本效率代价实现。
引用
@article{arxiv.2605.21214,
title = {Behavior-Consistent Deep Reinforcement Learning},
author = {Marcel Hussing and Liv G. d'Aliberti and Claas Voelcker and Benjamin Eysenbach and Eric Eaton},
journal= {arXiv preprint arXiv:2605.21214},
year = {2026}
}