利用选择性注意力建模非强化偏好
机器学习
2022-07-29 v1 人工智能
摘要
人工智能体如何学习非强化偏好以持续调整其行为以适应变化的环境?我们将此问题分解为两个挑战:()编码多样化记忆与()选择性关注这些记忆以形成偏好。我们提出的利用选择性注意力的非强化偏好学习机制\textsc{Nore}通过借助智能体的世界模型收集一组多样化经验(这些经验与想象 roll-out 交错以编码记忆)来解决上述两点。这些记忆通过注意力与门控模块被选择性关注,以更新智能体的偏好。我们在修改后的OpenAI Gym FrozenLake环境(无任何外部信号)中,在固定环境模型下、有波动与无波动条件下验证了\textsc{Nore},并将其行为与Hebbian偏好学习机制\textsc{Pepper}进行比较。我们证明\textsc{Nore}提供了一种在缺乏外部信号时诱导探索性偏好的直接框架。
引用
@article{arxiv.2207.13699,
title = {Modelling non-reinforced preferences using selective attention},
author = {Noor Sajid and Panagiotis Tigas and Zafeirios Fountas and Qinghai Guo and Alexey Zakharov and Lancelot Da Costa},
journal= {arXiv preprint arXiv:2207.13699},
year = {2022}
}
备注
4 pages, 3 figures - Workshop Track: 1st Conference on Lifelong Learning Agents, 2022