最优奖励最大化器世界模型的信息论分析
人工智能
2026-02-16 v1
摘要
AI 领域的一个重要问题是成功行为是否需要对世界具有内部表征。在本工作中,我们量化了最优策略关于 underlying 环境的提供信息。我们考虑一个有 n 个状态和 m 个动作的受控马尔可夫过程(CMP),假设对可能的转换动态的均匀先验。在证明了对于任何非恒定奖励函数的最优确定性策略 then convey 确切地 n log m 位关于环境的信息后,我们具体表明,环境与最优策略之间的互信息为 n log m 位。该界限适用于广泛的目标类,包括有限时序、无限时序折扣和时间平均奖励最大化。这些发现为最优性所必需的“隐式世界模型”提供了精确的信息论下界。
引用
@article{arxiv.2602.12963,
title = {Information-theoretic analysis of world models in optimal reward maximizers},
author = {Alfred Harwood and Jose Faustino and Alex Altair},
journal= {arXiv preprint arXiv:2602.12963},
year = {2026}
}
备注
28 pages, 0 figures. Not submitted to any conference yet