受神经启发的分片与回忆机制克服好奇心中的灾难性遗忘
人工智能
2023-10-27 v1 机器学习
摘要
深度强化学习方法在一系列任务上表现出令人印象深刻的性能,但在具有稀疏奖励的大型环境中的困难探索任务上仍举步维艰。为此,可利用前向模型预测误差生成内在奖励,其随环境被认知而减小,并激励智能体探索新颖状态。尽管基于预测的内在奖励能帮助智能体解决困难探索任务,它们可能遭受灾难性遗忘,并在已访问状态上实际增大。我们首先考察网格世界环境中灾难性遗忘的条件与成因。随后,受人类与动物学习方式的启发,我们提出一种新方法 FARCuriosity。该方法依赖于分片与回忆:智能体基于惊奇度对环境分片,并为每个片段使用不同的局部好奇心模块(基于预测的内在奖励函数),从而使各模块不在整个环境上训练。在每次分片事件时,智能体将当前模块存入长期记忆(LTM),并基于其与当前状态的匹配,初始化一个新模块或回忆一个先前存储的模块。借助分片与回忆,FARCuriosity 在具有多变且异构环境的 Atari 基准任务套件中实现了更少的遗忘与更优的整体性能。因此,本工作凸显了基于预测的好奇心方法中的灾难性遗忘问题并给出了一种解决方案。
引用
@article{arxiv.2310.17537,
title = {Neuro-Inspired Fragmentation and Recall to Overcome Catastrophic Forgetting in Curiosity},
author = {Jaedong Hwang and Zhang-Wei Hong and Eric Chen and Akhilan Boopathy and Pulkit Agrawal and Ila Fiete},
journal= {arXiv preprint arXiv:2310.17537},
year = {2023}
}
备注
NeurIPS 2023 Workshop - Intrinsically Motivated Open-ended Learning