基于信念状态的RWKV强化学习:针对部分可观测性问题
机器学习
2026-04-14 v1
摘要
我们在RWKV类循环序列模型之上提出了一种更强的强化学习表述,其中固定大小的循环状态被显式解释为信念状态,而非不透明的隐藏向量。相较于仅依据单个摘要h_t进行策略与价值决策,我们维护一个紧凑且具不确定性感知的状态b_t = (μ_t, Σ_t),源自RWKV式循环统计数据,并使控制决策依赖于记忆与不确定性。此设计针对纯固定状态策略在部分可观测环境中的关键弱点:它们可能存储证据,却不一定存储置信度。我们提供了方法、理论框架,并进行了一次以隐藏episode级观察噪声为基础的试验性强化学习实验,包含测试时噪声扫描。试验结果表明,信念状态策略在整体上几乎匹配最佳循环基线,同时在最难的分布内 regime 以及持续out-of-distribution噪声偏移下略有提升。额外的消融实验显示,此简单的信念读取机制目前优于两种更结构化的扩展,即门控记忆控制与特权信念目标,凸显了需要更丰富基准的必要性。
引用
@article{arxiv.2604.09671,
title = {Belief-State RWKV for Reinforcement Learning under Partial Observability},
author = {Liu Xiao},
journal= {arXiv preprint arXiv:2604.09671},
year = {2026}
}