奖励并不足够:我们能否将人工智能从强化学习范式中解放出来?
人工智能
2024-11-12 v3
摘要
我针对 Silver、Singh、Precup 和 Sutton(https://www.sciencedirect.com/science/article/pii/S0004370221000862)提出的假说给出反驳论据:奖励最大化不足以解释与自然及人工智能相关的诸多活动,包括知识、学习、感知、社会智能、演化、语言、泛化与模仿。我指出,这种 reductio ad lucrum(归约为利益)在智识上源于理性经济人(Homo economicus)的政治经济学,并与激进版行为主义高度重叠。我说明了为何强化学习范式尽管在某些实际应用中有明显效用,却仍是(自然与人工)智能的不完备框架——智能行为的复杂性并非简单地叠加在奖励最大化之上的二阶扰动。这一事实对开发实用、智能、安全且鲁棒的人工智能体具有深远影响。
引用
@article{arxiv.2202.03192,
title = {Reward is not enough: can we liberate AI from the reinforcement learning paradigm?},
author = {Vacslav Glukhov},
journal= {arXiv preprint arXiv:2202.03192},
year = {2024}
}
备注
27 pages, 1 figure