策略转换下认知行为结构非保护性
机器学习
2026-03-23 v2 人工智能
摘要
在部分可观测情境下的强化学习 (RL) 智能体,常会基于内部积累的信息(如记忆或推断潜在情境)来条件化动作选择。我们将此类信息条件化的互动模式正式化为行为依赖:即在固定观测下,依据内部信息而产生的动作选择变异。这种依赖性诱导一种相对探针的 行为等价概念,以及策略内部的行为距离,用以量化探针灵敏度。我们提出三项结构性结果。首先,表现出非平凡行为依赖性的策略集合在凸组合下并非封闭。其次,行为距离在凸组合下会收缩。第三,我们证明了当主导模式梯度与最陡收缩方向对齐时,梯度上升于倾斜混合目标可减少行为距离的充分局部条件。最小化的 bandit 和部分可观测网格世界实验提供了这些机制的受控见证。在所检验的情境中,行为距离在凸聚合和持续优化(以倾斜潜在先验为条件)下会减小,而在潜在先验迁移情况下则会导致性能下降。这些结果识别了在常见策略转换下,探针条件化的行为分离不被保留的结构条件。
引用
@article{arxiv.2602.21424,
title = {On the Structural Non-Preservation of Epistemic Behaviour under Policy Transformation},
author = {Alexander Galozy},
journal= {arXiv preprint arXiv:2602.21424},
year = {2026}
}
备注
15 pages, 3 figures. Under review at RLC 2026. Fixed references due to copy-paste errors