通过误差控制动力学重新思考循环模型中的状态跟踪
机器学习
2026-05-11 v1 计算与语言
摘要
循环架构中状态跟踪的理论主要关注表达能力:一个固定架构是否能在理论上实现一组符号转换规则。我们认为同等重要的是误差控制,即控制隐藏状态沿区分符号状态的方向漂移的动力学。我们证明,仿射循环网络(一类包含状态空间模型和线性注意力的模型)一旦保留了状态表示,就无法纠正沿状态分离子空间的误差。因此,实际的仿射跟踪器并未学习到鲁棒的状态跟踪;相反,它们学习的是由累积的状态相关误差控制的有限时域解。我们刻画了这种失效的机制,表明只有当累积的类内散布相对于初始类间分离保持较小时,跟踪才保持可读。我们在群状态跟踪任务上通过实验证明,这种崩溃是可预测的:当可区分性比率超过训练解码器的可读性阈值时,跟踪就会崩溃。在训练好的模型中,该交叉点预测了下游准确性失效的时域。这些结果表明,鲁棒的状态跟踪不仅由架构的理论表达能力决定,而且关键地由其误差控制决定。
引用
@article{arxiv.2605.07755,
title = {Rethinking State Tracking in Recurrent Models Through Error Control Dynamics},
author = {Jiwan Chung and Heechan Choi and Seon Joo Kim},
journal= {arXiv preprint arXiv:2605.07755},
year = {2026}
}