中文

带可复用状态依赖价值轮廓的主动推理

机器学习 2025-12-16 v1 人工智能 机器学习

摘要

在动态环境中适应行为需要智能体在潜在语境间切换价值控制策略,但为每种情境维护独立的偏好、政策偏差和动作置信度参数是不可行的。我们提出价值轮廓(value profiles):一组可复用的价值相关参数包(结果偏好、政策先验和政策精度),分配给生成模型中的隐状态。随着后验信念逐试验演化,有效控制参数通过信念加权混合产生,使状态条件性策略调用成为可能,而无需为每个语境设置独立参数。我们在概率反转学习中评估该框架,比较静态精度、熵耦合动态精度和基于轮廓的模型,使用交叉验证对数似然和信息准则。模型比较显示基于轮廓的模型优于更简单的替代方案(AIC差异约100分),参数恢复分析支持结构可识别性,即使语境必须从噪声观测中推断。基于模型的进一步推断表明,该任务中的自适应控制主要由政策先验的调制驱动,而非政策精度,渐进式信念依赖轮廓调用符合状态条件性(而非纯粹不确定性驱动)控制。总体而言,可复用的价值轮廓为动态环境中基于信念的价值控制提供了可处理的计算解释,并产生了可检验的信念依赖控制和行为灵活性的特征。

关键词

引用

@article{arxiv.2512.11829,
  title  = {Active Inference with Reusable State-Dependent Value Profiles},
  author = {Jacob Poschl},
  journal= {arXiv preprint arXiv:2512.11829},
  year   = {2025}
}

备注

27 pages