基于模型的强化学习中的性能不对称性
机器学习
2026-02-25 v3 人工智能
机器人学
摘要
近期,基于模型的强化学习(MBRL)在 Atari100k 基准测试上的平均表现已达到超人类水平。然而,我们发现常规的聚合指标掩盖了一个重大问题:性能不对称性,即 MBRL 智能体在某些任务(智能体最优任务)上表现远超人类,而在其他任务(人类最优任务)上表现远逊于人类。事实上,尽管在总体平均人类归一化得分(HNS)上达到了 SOTA,该 SOTA 智能体在人类最优任务上的表现却是所有基线中最差的,且在人类最优与智能体最优子集之间存在高达 21 倍的显著性能差距。为解决此问题,我们将 Atari100k 均匀划分为人类最优和智能体最优子集,并引入了一个更均衡的聚合指标 Sym-HNS。此外,我们将 SOTA 像素扩散世界模型中显著的性能不对称性追溯到维度灾难及其在高视觉细节任务(如 Breakout)上的优势。为此,我们提出了一种新颖的潜在端到端联合嵌入扩散(JEDI)世界模型,该模型在 Sym-HNS、人类最优任务和 Breakout 上均取得了 SOTA 结果——从而在逆转性能不对称性恶化趋势的同时,提升了计算效率,并在完整的 Atari100k 上保持了竞争力。
引用
@article{arxiv.2505.19698,
title = {Performance Asymmetry in Model-Based Reinforcement Learning},
author = {Jing Yu Lim and Rushi Shah and Zarif Ikram and Samson Yu and Haozhe Ma and Tze-Yun Leong and Dianbo Liu},
journal= {arXiv preprint arXiv:2505.19698},
year = {2026}
}
备注
Preprint