基于路由的表示学习:克服多时间尺度 PPO 中的代理漏洞
机器学习
2026-05-25 v3 人工智能
摘要
强化学习中的时序信用分配长期以来是核心挑战之一。受神经生物学中多时间尺度多巴胺系统编码的启发,近期研究试图在演员-评论员架构中引入多个折扣因子,如 Proximal Policy Optimization (PPO),以平衡短期反应与长期规划。然而,本文揭示了在复杂延迟奖励任务中盲目融合多时间尺度信号会导致严重的算法病态。我们系统性地演示了将时序注意力路由机制暴露给策略梯度会导致代理目标漏洞,而采用梯度-free 不确定性加权则触发不可逆的仔慎衰退,我们称之为时序不确定性悖论。为此,我们提出了一种目标解耦架构:在评论员端,我们保留多时间尺度预测以强制进行辅助表示学习,而在演员端,我们严格隔离短期信号,仅基于长期优势更新策略。严格的经验评估在 LunarLander-v2 环境中进行多个独立随机种子下,证明我们提出的架构实现了统计显著的性能提升。该架构不依赖于超参数漏洞,始终稳健地超过“环境已解决”阈值,完全消除策略崩溃,并摆脱单时间尺度基线所困的悬停局部最优。我们的实验代码已公开发布于 https://github.com/ben-dlwlrma/Representation-Over-Routing。
引用
@article{arxiv.2604.13517,
title = {Representation over Routing: Overcoming Surrogate Hacking in Multi-Timescale PPO},
author = {Jing Sun},
journal= {arXiv preprint arXiv:2604.13517},
year = {2026}
}
备注
8 pages, 6 figures