关于脑启发强化学习算法的可靠性与泛化能力
人工智能
2020-07-10 v1 神经元与认知
摘要
尽管深度强化学习模型在解决各种类型任务时表现出巨大潜力且只需极少监督,但在从有限经验中学习、适应环境变化以及从单一任务中泛化学习等方面仍存在几个关键挑战。决策神经科学的最新证据表明,人脑具有解决这些问题的先天能力,这使人们对开发神经科学启发的样本高效且可泛化的强化学习算法持乐观态度。我们展示了结合基于模型和无模型控制的计算模型(我们称之为前额叶强化学习)能够可靠地编码人类所学的高级策略信息,并且该模型可以将学到的策略泛化到广泛的任务中。首先,我们在82名受试者的数据上训练了前额叶强化学习和深度强化学习算法,这些数据是在人类参与者执行两阶段马尔可夫决策任务时收集的,其中我们操纵了目标、状态转移不确定性和状态空间复杂度。在可靠性测试(包括潜在行为特征和参数可恢复性测试)中,我们表明前额叶强化学习可靠地学习了人类的潜在策略,而所有其他模型都失败了。其次,为了测试这些模型从原始任务中学到的内容的泛化能力,我们将它们置于环境波动性的背景下。具体来说,我们使用10个马尔可夫决策任务进行了大规模模拟,其中潜在上下文变量随时间变化。我们的信息论分析表明,前额叶强化学习表现出最高水平的适应性和情景编码效能。这是首次正式测试模仿大脑解决一般问题方式的计算模型能否为机器学习中的关键挑战提供实际解决方案的可能性。
引用
@article{arxiv.2007.04578,
title = {On the Reliability and Generalizability of Brain-inspired Reinforcement Learning Algorithms},
author = {Dongjae Kim and Jee Hang Lee and Jae Hoon Shin and Minsu Abel Yang and Sang Wan Lee},
journal= {arXiv preprint arXiv:2007.04578},
year = {2020}
}