SPRIG:基于内部博弈动态的堆栈贝尔格感知-强化学习框架
人工智能
2025-02-21 v1
摘要
深度强化学习智能体面临着在高维感知输入环境中有效协调感知与决策组件方面的挑战,尤其是在特征相关性变化的环境中。本文引入SPRIG(Stackelberg Perception-Reinforcement learning with Internal Game dynamics),一个模型化单个智能体内部感知-策略相互作用的框架,将其建模为合作堆栈贝尔格博弈。在SPRIG中,感知模块作为领袖,战略性地处理原始感知状态,而策略模块则作为跟随者,基于提取的特征做出决策。SPRIG通过修改的Bellman算子提供理论保证,同时保留现代策略优化的优势。在Atari BeamRider环境上的实验结果表明,SPRIG通过博弈论平衡实现了特征提取与决策之间的协调,相较于标准PPO实现了约30%的更高回报。
引用
@article{arxiv.2502.14264,
title = {SPRIG: Stackelberg Perception-Reinforcement Learning with Internal Game Dynamics},
author = {Fernando Martinez-Lopez and Juntao Chen and Yingdong Lu},
journal= {arXiv preprint arXiv:2502.14264},
year = {2025}
}
备注
To appear in: AAAI 2025 Workshop on Planning and Reinforcement Learning (PRL) - Bridging the Gap Between AI Planning and Reinforcement Learning