KAGE-Bench:强化学习快速已知轴视觉泛化评估
机器学习
2026-01-21 v1 人工智能
计算机视觉与模式识别
摘要
基于像素的强化学习智能体在纯粹的视觉分布迁移下往往会失败,即使潜在动力学和奖励保持不变。但现有基准测试将多种迁移源 entangled 在一起,妨碍系统化分析。我们引入 KAGE-Env,一个 JAX 天然 2D 平台游戏,将观察过程分解为可独立控制的视觉轴,同时维持底层控制问题不变。通过构造,改变某一视觉轴仅通过像素策略的状态条件动作分布产生影响,为视觉泛化提供干净的抽象。基于此环境,我们定义 KAGE-Bench,包含六套已知轴套组,涵盖 34 对训练-评估配置对,用以隔离单个视觉迁移。使用标准 PPO-CNN 基线,我们观察到强烈的轴依赖性失效,其中背景和光照迁移常常导致成功率崩溃,而智能体-外观迁移相对温和。若干迁移保留前进动作但破坏任务完成,显示仅凭回报可能掩盖泛化失效。最终,完全向量化的 JAX 实现使我们在单块 GPU 上可达每秒 3300 万环境步,实现对视觉因素的快速且可复现的扫描。代码:https://avanturist322.github.io/KAGEBench/。
引用
@article{arxiv.2601.14232,
title = {KAGE-Bench: Fast Known-Axis Visual Generalization Evaluation for Reinforcement Learning},
author = {Egor Cherepanov and Daniil Zelezetsky and Alexey K. Kovalev and Aleksandr I. Panov},
journal= {arXiv preprint arXiv:2601.14232},
year = {2026}
}
备注
38 pages, 44 figures, 3 tables