奖励何时教会状态?一个隐藏自动机工具与群语言边界
摘要
一个获得高奖励的强化学习代理是否表示其任务的潜在状态,还是仅仅表示一个与奖励相关的捷径?这个问题通常无法回答:因为“真实状态”是未定义的。我们用一个白盒工具使其可以精确回答:将任务表示为一个隐藏的确定性有限自动机(DFA),让代理观察符号流并在部分控制下间歇性地选择下一个符号,并为接受授予一个稀疏的终止奖励。知道自动机可以免费获得两件事:最优回报(因此奖励成为一个可解释的归一化分数)和每一步的精确潜在状态(因此我们可以在不展示它的情况下探测代理的表示)。奖励成功和潜在状态学习因此成为可分别测量的量,它们的耦合由三个可控轴控制。优化器强度:在弱策略 RL 下,代理获得奖励,而状态探针对于每种架构都处于随机水平,这诱使人们得出稀疏 RL 无法安装潜在状态的结论;一个预先注册的控制推翻了这一点——PPO+GAE 恢复了状态,但只是部分恢复且种子方差很高。任务结构:置换(群语言)结构是一个可以在任何训练之前从转移函数计算出的警告信号,并且在 153 个容量受控的新自动机上留出验证时,它以 0.86 的精度(103 个中的 89 个)单向标记了感知差距。观察信息量:当观察不携带状态时,无标签辅助是空洞的,并且它恢复状态的程度与观察揭示状态的程度成正比。其回报是仅奖励评估无法做出的区分:感知差距(潜在状态不能线性恢复,但可表示)与规划差距(状态可恢复但未使用)。因此,高奖励不是任务理解的证据;代理是否恢复潜在状态是可以提前预测的。
引用
@article{arxiv.2607.11953,
title = {When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary},
author = {Jim Allchin},
journal= {arXiv preprint arXiv:2607.11953},
year = {2026}
}
备注
14 pages, 2 figures, 5 tables (8-page main text; the remainder is references and appendices). Reproduction code and the complete per-run data behind every table and figure are attached as an arXiv ancillary file (hidden-automata-rl-code.zip). Includes a pre-registered control that overturned an initial over-strong claim