中文

基于体积增长变换探索强化学习游戏的分层空间结构

代数拓扑 2025-07-30 v1 人工智能 计算几何 机器学习 微分几何

摘要

在本工作中,我们探讨了为玩耙一款特定强化学习 (RL) 游戏而训练的变换模型嵌入空间的结构。具体而言,我们调查了基于变换的近端策略优化 (PPO) 模型如何在一个简单环境中嵌入视觉输入——该环境要求智能体收集“硬币”,同时避免由“手电筒”组成的动态障碍物。通过 adapting Robinson 等人关于大语言模型体积增长变换的研究方法,我们发现用于视觉硬币收集游戏的 token 嵌入空间也非流形,更适合作为分层空间建模,其中局部维度可从点至点变化。我们进一步通过证明相当通用的体积增长曲线可由分层空间实现,强化了 Robinson 的方法。最终,我们进行的分析表明,随着 RL 智能体的行动,其潜在表示在固定子策略的跟随期间交替为局部维度较低的阶段,以及在实现子目标(例如收集物体)或环境复杂度增加(例如出现更多障碍物)时局部维度激增的阶段。因此,我们的工作表明,分层潜在空间中维度分布可能为 RL 游戏提供一种新的几何复杂度指标。

关键词

引用

@article{arxiv.2507.22010,
  title  = {Exploring the Stratified Space Structure of an RL Game with the Volume Growth Transform},
  author = {Justin Curry and Brennan Lagasse and Ngoc B. Lam and Gregory Cox and David Rosenbluth and Alberto Speranzon},
  journal= {arXiv preprint arXiv:2507.22010},
  year   = {2025}
}

备注

17 pages and 8 figures. Preliminary report. Feedback welcome!