并非所有不确定性都相同:波动性、随机性与探索
人工智能
2026-05-20 v1
摘要
生物与人工智能中的自适应决策需要在已知结果的开发与不确定性备选方案的探索之间进行平衡。尽管先前工作表明不确定性通常促进探索,但通常将不同来源的环境不确定性视为等价。我们考虑具有潜在奖励状态随时间漂移(波动性)和通过噪声结果观察(随机性)的环境。两者都增加后验不确定性,但我们表明它们对最优探索的驱动方向相反:波动性促进探索,随机性抑制探索。我们通过扩展 Gittins 指数框架到具有潜在动态的高斯状态空间 bandit,正式证明了这一不对称性。我们进一步推导出 Cause-Aware Uncertainty-Sensitive Exploration(CAUSE),通过控制-推断获得闭形式的探索奖励,继承了相同的单调性。CAUSE 在具有异构噪声结构的环境中超越标准探索策略,同样改进了 Gittins-per-arm 策略,其休眠 bandit 最优性并不适用于休眠环境。学习与探索由相同的噪声-推断不对称性支配,框架预测病理性噪声推断会产生而非仅仅受阻的探索,对精神疾病的计算账户具有启示。
引用
@article{arxiv.2605.19215,
title = {Not all uncertainty is alike: volatility, stochasticity, and exploration},
author = {Payam Piray},
journal= {arXiv preprint arXiv:2605.19215},
year = {2026}
}