中文

模型-价值不一致作为认知不确定性的信号

机器学习 2022-07-01 v3 人工智能

摘要

利用环境模型和价值函数,智能体可以通过将模型展开不同长度并使用其价值函数进行自助法,来构建一个状态价值的多个估计。我们的关键洞察是,可以将这组价值估计视为一种集成,我们称之为隐式价值集成 (IVE)。因此,这些估计之间的差异可以作为智能体认知不确定性的代理;我们将此信号称为模型-价值不一致,或简称自不一致。与以往通过训练多个模型和/或价值函数的集成来估计不确定性的工作不同,该方法仅需大多数基于模型的强化学习算法中已经在学习的单个模型和价值函数。我们在表格设置和基于像素的函数逼近设置中提供了经验证据,表明自不一致是有用的: 作为探索的信号; 在分布偏移下安全行动; 以及利用学习到的模型来强化基于价值的规划。

关键词

引用

@article{arxiv.2112.04153,
  title  = {Model-Value Inconsistency as a Signal for Epistemic Uncertainty},
  author = {Angelos Filos and Eszter Vértes and Zita Marinho and Gregory Farquhar and Diana Borsa and Abram Friesen and Feryal Behbahani and Tom Schaul and André Barreto and Simon Osindero},
  journal= {arXiv preprint arXiv:2112.04153},
  year   = {2022}
}

备注

The first three authors contributed equally. Accepted at ICML 2022