中文

强化学习智能体遇到未知未知时的情况

机器学习 2025-09-04 v2 人工智能 机器学习

摘要

AI智能体可能会惊讶地发现自己到达了一个从未被意识到的未知状态——即未知的未知。我们在强化学习中对这一情景进行数学建模:智能体在基于定义在“感知域”上的价值函数 QQVV 计算动作后,到达该域之外的状态。为使智能体能够处理这一情景,我们提出了一种“具有扩张感知的情节马尔可夫决策过程”(EMDP-GA)模型,采用一种新的“非信息性价值扩张”(NIVE)方法,将价值函数扩张到新发现的感知区域:当智能体到达未知的未知时,用非信息性信念(即感知域上平均值)对价值函数 QQVV 进行初始化。此设计尊重了在新发现状态中完全缺乏知识的事实。随后,我们将上置置信界动量Q学习适用于扩张感知,以训练EMDP-GA模型。我们证明了:(1)在极不确定环境下,我们的方法的后悔值渐近地与最先进技术(SOTA)一致,且不暴露于未知的未知;(2)我们的计算复杂度和空间复杂度与SOTA相当——这些共同表明,尽管未知的未知是令人惊讶的,但它将以可接受的速度和成本被渐近正确地发现。

关键词

引用

@article{arxiv.2505.13188,
  title  = {When a Reinforcement Learning Agent Encounters Unknown Unknowns},
  author = {Juntian Zhu and Miguel de Carvalho and Zhouwang Yang and Fengxiang He},
  journal= {arXiv preprint arXiv:2505.13188},
  year   = {2025}
}