新奇产生型突触可塑性
神经与进化计算
2020-12-21 v1 人工智能
摘要
具有可塑性属性的学习过程通常需要强化信号来引导该过程。然而,在某些任务(例如迷宫导航)中,由于目标位置未知,很难(或不可能)衡量智能体的表现(即适应度值)以提供强化。这要求在不具备强化信号知识的情况下,从大量可能行为中找到正确行为。在这些情况下,可能需要穷举搜索。但这可能不可行,特别是在连续域中优化人工神经网络时。本工作中,我们引入新奇产生型突触可塑性(NPSP),通过演化突触可塑性规则来产生尽可能多的新奇行为,从而找到能解决问题的行为。我们在需要复杂动作和达成子目标才能完成的欺骗性迷宫环境的迷宫导航上评估 NPSP。我们的结果表明,与作为基线的随机搜索相比,所提 NPSP 使用的搜索启发式确实能够产生多得多的新奇行为。
引用
@article{arxiv.2002.03620,
title = {Novelty Producing Synaptic Plasticity},
author = {Anil Yaman and Giovanni Iacca and Decebal Constantin Mocanu and George Fletcher and Mykola Pechenizkiy},
journal= {arXiv preprint arXiv:2002.03620},
year = {2020}
}