中文

最优奖励最大化器世界模型的信息论分析

人工智能 2026-02-16 v1

摘要

AI 领域的一个重要问题是成功行为是否需要对世界具有内部表征。在本工作中,我们量化了最优策略关于 underlying 环境的提供信息。我们考虑一个有 n 个状态和 m 个动作的受控马尔可夫过程(CMP),假设对可能的转换动态的均匀先验。在证明了对于任何非恒定奖励函数的最优确定性策略 then convey 确切地 n log m 位关于环境的信息后,我们具体表明,环境与最优策略之间的互信息为 n log m 位。该界限适用于广泛的目标类,包括有限时序、无限时序折扣和时间平均奖励最大化。这些发现为最优性所必需的“隐式世界模型”提供了精确的信息论下界。

关键词

引用

@article{arxiv.2602.12963,
  title  = {Information-theoretic analysis of world models in optimal reward maximizers},
  author = {Alfred Harwood and Jose Faustino and Alex Altair},
  journal= {arXiv preprint arXiv:2602.12963},
  year   = {2026}
}

备注

28 pages, 0 figures. Not submitted to any conference yet