中文

人类的不确定性量化与探索-利用权衡

人工智能 2021-02-16 v1 机器学习

摘要

本文的主要目标是勾勒一个理论框架,以分析人类在不确定性下的决策策略如何管理信息收集(探索)与奖励寻求(利用)之间的权衡。推动这一研究思路的一个关键观察是,意识到人类学习者在适应陌生环境和吸收新出现知识方面异常快速且有效:这对认知科学而言是一种引人入胜的行为,对机器学习而言也是一项重要挑战。所考虑的目标问题是在黑盒优化任务中的主动学习,更具体地,是如何在基于高斯过程的贝叶斯优化框架内对探索/利用困境进行建模,而该框架又基于不确定性量化。主要贡献是从帕累托理性角度分析人类的决策,其中两个目标是改进期望与不确定性量化。根据这一帕累托理性模型,如果一个决策集包含帕累托高效(占优)策略,理性决策者应始终选择占优策略而非其被占优的替代方案。距帕累托前沿的距离决定了一个选择是否是(帕累托)理性的(即位于前沿上)或与“过度”探索相关。然而,由于不确定性是定义帕累托前沿的两个目标之一,我们研究了三种不同的不确定性量化度量,并选择了与所提帕累托理性模型更相符的一种。关键结果是刻画偏离“理性”如何依赖于不确定性量化以及奖励寻求过程演进的分析框架。

关键词

引用

@article{arxiv.2102.07647,
  title  = {Uncertainty quantification and exploration-exploitation trade-off in humans},
  author = {Antonio Candelieri and Andrea Ponti and Francesco Archetti},
  journal= {arXiv preprint arXiv:2102.07647},
  year   = {2021}
}