中文

后验更新奖励表征的笔记

机器学习 2026-02-04 v1 人工智能 机器学习

摘要

现代控制与强化学习中的许多思想将决策过程视为推理:从基线分布出发,当信号到达时进行更新。我们探讨何时可以将其变为字面意义上的推理,而非隐喻。我们研究特殊情况:KL 正则化软更新恰好是单个固定概率模型中的贝叶斯后验,因此更新变量是通过信息传递的真实信道。在此情境下,行为变化仅由该信道携带的证据驱动:更新必须可被基线的证据重新加权来解释。这导致一个尖锐的识别结果:后验更新决定行为 shifts 的相对、情境依赖的激励信号,但它们不唯一确定绝对奖励,后者相对于情境特定基线保持模糊。要求在不同更新方向上使用一个可重复的 continuation value 进一步添加了一个关联约束,链接不同条件顺序所对应的奖励描述。

关键词

引用

@article{arxiv.2602.02912,
  title  = {Notes on the Reward Representation of Posterior Updates},
  author = {Pedro A. Ortega},
  journal= {arXiv preprint arXiv:2602.02912},
  year   = {2026}
}

备注

Technical report, 9 pages