中文

迈向 neoRL 网络:目的图的出现

人工智能 2022-02-28 v1

摘要

用于目的性 AI 的 neoRL 框架通过模拟认知地图实现潜在学习,以通用值函数(GVF)表达对分离状态的操作性欲望。智能体对奖励的期待表现为所考量空间中的学习投影,使 neoRL 智能体能依据奖励假说从学习到的地图中提取目的性行为。我们进一步探究这一类比,将 neoRL 模块视为网络中以欲望为输入、以状态-动作 Q 值为输出的节点;我们看到,具有欧几里得意义的动作集意味着将状态-动作向量解释为欲望的欧几里得投影。来自智能体内 neoRL 节点的自主欲望允许更深层的 neoRL 行为图。实验证实了由自主欲望支配的 neoRL 网络的效果,验证了目的性网络的四条原则。由目的性网络支配的 neoRL 智能体能在学习的同时实时导航欧几里得空间,例证了现代 AI 仍可从早期心理学汲取灵感。

关键词

引用

@article{arxiv.2202.12622,
  title  = {Towards neoRL networks; the emergence of purposive graphs},
  author = {Per R. Leikanger},
  journal= {arXiv preprint arXiv:2202.12622},
  year   = {2022}
}

备注

Submission to RLDM 2022