主动推理智能体中的先验偏好:软目标、硬目标与目标塑形
人工智能
2025-12-04 v1 神经元与认知
摘要
主动推理提出期望自由能作为规划与决策的目标,以在智能体的利用驱动与探索驱动之间取得平衡。利用驱动,即智能体想要实现的目标,被形式化为变分概率分布(每次推理步骤更新)与偏好概率分布之间的Kullback-Leibler散度;偏好概率分布指示哪些状态或观测对智能体更可能出现,从而确定智能体在特定环境中的目标。在文献中,关于偏好分布应如何指定以及某种指定如何影响主动推理智能体中的推理与学习的问题几乎未受到关注。在本工作中,我们考虑了定义偏好分布的四种可能方式,即提供硬目标或软目标,并是否涉及目标塑形(即中间目标)。我们比较了四个智能体(每个给定一种可能的偏好分布)在网格世界导航任务中的表现。结果表明,目标塑形总体上实现了最佳性能(即促进利用),但牺牲了对环境转换动力学的学习(即阻碍探索)。
引用
@article{arxiv.2512.03293,
title = {Prior preferences in active inference agents: soft, hard, and goal shaping},
author = {Filippo Torresan and Ryota Kanai and Manuel Baltieri},
journal= {arXiv preprint arXiv:2512.03293},
year = {2025}
}
备注
41 pages, 23 figures