信用分配:开发类人 AI 智能体面临的挑战与机遇
人工智能
2023-07-18 v1 人机交互
摘要
时间信用分配对于自然智能与人工智能中的学习与技能发展至关重要。尽管已提出诸如强化学习中的 TD 方法等计算方法,但尚不清楚它们是否准确表征了人类如何处理反馈延迟。认知模型旨在表征人类解决问题并执行多项任务时的心理步骤,但认知科学中针对人类与认知模型的信用分配问题的研究十分有限。我们的研究基于一种来自经验决策理论——基于实例的学习理论(IBLT),使用认知模型在具有不同决策复杂度的目标导向导航任务中测试多种信用分配机制。基于实例的学习(IBL)模型模拟了采用不同信用分配机制进行序贯选择的过程,其中包括一种将 IBL 决策机制与 TD 方法相结合的新型 IBL-TD 模型。我们发现:(1)对所有决策给予均等信用分配的 IBL 模型比其他模型(包括 IBL-TD 与 Q-learning)更能匹配人类表现;(2)IBL-TD 与 Q-learning 模型初期表现不及人类,但最终会超越人类;(3)人类受决策复杂度影响,而模型则不受影响。我们的研究为刻画人类行为的挑战以及在未来 AI 系统中利用这些模型以支持人类活动的潜在机遇提供了见解。
引用
@article{arxiv.2307.08171,
title = {Credit Assignment: Challenges and Opportunities in Developing Human-like AI Agents},
author = {Thuy Ngoc Nguyen and Chase McDonald and Cleotilde Gonzalez},
journal= {arXiv preprint arXiv:2307.08171},
year = {2023}
}
备注
11 figures; 3 tables