强化世界边缘:多智能体世界边界中的持续学习问题
人工智能
2026-03-10 v1
摘要
在强化学习中,可重用的决策结构跨回合存活,但这取决于智能体-世界边界的划分方式。在 stationary、有限时限的 MDP 中,可以构建一个不变的核心:由所有成功轨迹共享的(非必然连贯的)状态-动作序列(可选地在简单抽象下)。在轻度目标条件假设下,该核心的存在性可被证明,并通过它捕获跨回合迁移的雏形。当同一任务嵌入到去中心化马尔可夫博弈中且对等智能体被纳入世界时,每一次对等策略更新都会诱导出一个新的 MDP;每回合的不变核心可能缩小或消失,即便对诱导世界动力学进行细微变更,也常常只剩下单个任务核心或甚至没有任何核心。这种策略诱导的非平稳性可通过对诱导核和奖励的变动预算来量化,将边界漂移与核心丧失关联。将 agent-世界边界不稳定(而非外部任务切换)视为去中心化 MARL 中持续 RL 问题的视角,指向未来在保持、预测或以其他方式管理边界漂移方面的工作方向。
引用
@article{arxiv.2603.06813,
title = {Reinforcing the World's Edge: A Continual Learning Problem in the Multi-Agent-World Boundary},
author = {Dane Malenfant},
journal= {arXiv preprint arXiv:2603.06813},
year = {2026}
}
备注
Accepted at the World Modeling Workshop 2026