心智与机器中元认知的算法理论
人工智能
2021-11-09 v1 机器学习
摘要
人类有时会选择他们自己即使在没有额外信息的情况下也能识别为次优或错误的动作。这如何可能?我们基于强化学习(RL)中基于价值的 RL 与基于策略的 RL 之间一种被充分理解的权衡,提出了一种元认知的算法理论。对于认知(神经)科学界,我们的理论回答了为何信息可用于错误检测却不能用于动作选择这一悬而未决的问题。对于机器学习界,我们提出的理论在 Actor-Critic 智能体中创造了 Actor 与 Critic 之间的新颖交互,并指出 RL 与贝叶斯优化之间的新颖联系。我们将提出的智能体称为元认知 Actor-Critic(MAC)。最后我们展示了如何通过实现深度 MAC 在机器中创建元认知,并表明它无需外部信息或延迟即可检测(部分)自身的次优动作。
关键词
引用
@article{arxiv.2111.03745,
title = {An Algorithmic Theory of Metacognition in Minds and Machines},
author = {Rylan Schaeffer},
journal= {arXiv preprint arXiv:2111.03745},
year = {2021}
}