预测编码增强元强化学习:在部分可观测性下实现可解释的贝叶斯最优信念表示
人工智能
2025-10-28 v1 神经元与认知
摘要
学习历史的紧凑表示对于部分可观测环境中的规划和泛化至关重要。虽然元强化学习 (RL) 智能体可以达到接近贝叶斯最优的策略,但它们往往未能学习紧凑且可解释的贝叶斯最优信念状态。这种表征效率不足可能限制了智能体的适应性和泛化能力。受神经科学中预测编码的启发——该理论表明大脑通过贝叶斯推断预测感官输入——以及深度强化学习中辅助预测目标的启发,我们探讨了将自监督预测编码模块集成到元强化学习中以促进贝叶斯最优表征的学习。通过状态机仿真,我们展示,在各种任务中,包括即使两者都达到最优策略时,元强化学习配合预测模块 consistently 生成更可解释的表征,能够更好地逼近贝叶斯最优信念状态,而常规元强化学习则不行。在需要主动信息寻求的挑战性任务中,只有元强化学习配合预测模块成功学习了最优表征和策略,而常规元强化学习则因表征学习不足而受挫。最后,我们证明,更好的表征学习导致更好的泛化。我们的结果强有力地表明,预测学习作为智能体在部分可观测性环境中有效表征学习的指导原则。
引用
@article{arxiv.2510.22039,
title = {Predictive Coding Enhances Meta-RL To Achieve Interpretable Bayes-Optimal Belief Representation Under Partial Observability},
author = {Po-Chen Kuo and Han Hou and Will Dabney and Edgar Y. Walker},
journal= {arXiv preprint arXiv:2510.22039},
year = {2025}
}
备注
Accepted to Annual Conference on Neural Information Processing Systems (NeurIPS) 2025