中文

更高分辨率,更好泛化:解锁深度强化学习中的视觉比例

机器学习 2026-05-12 v1

摘要

基于像素的深度强化学习智能体通常在重度下采样的视觉观测上进行训练,这一做法继承自早期基准而非建立在原则设计之上。本文展示,观测分辨率是策略学习中一个关键且被忽视的变量:更高的分辨率输入可显著提高性能和泛化性,前提是网络架构能够有效处理它们。我们发现,广泛使用的 Impala 编码器因将空间特征展平为向量而在分辨率提升时出现参数呈二次增长,并未利用额外的视觉细节。用全局平均池化取代该操作,如 Impoola 架构中所示,可将参数数量与分辨率解耦,并在不同分辨率和网络宽度下实现持续的性能提升——在各自最佳条件下,视觉比例为 Impoola 相对于 Impala 带来 28% 的性能提升。这些收益在需要精确感知小或远距离物体的环境中最为显著,梯度可视化分析确认,底层机制是更高分辨率下策略的更局部视觉注意力。我们的结果挑战了激进输入下采样的主流做法,并将分辨率无关架构定位为通用、有效的可扩展视觉深度强化学习之路。为促进深度强化学习中分辨率比例的未来研究,我们公开发布 Impoola 架构的 Procgen-HD 基准代码:https://github.com/raphajaner/procgen-hd。

关键词

引用

@article{arxiv.2605.10546,
  title  = {Higher Resolution, Better Generalization: Unlocking Visual Scaling in Deep Reinforcement Learning},
  author = {Raphael Trumpp and Ömer Veysel Çağatan and Barış Akgün and Marco Caccamo},
  journal= {arXiv preprint arXiv:2605.10546},
  year   = {2026}
}