Ask-AC:一种主动式顾问在环的 Actor-Critic 框架
机器学习
2024-05-27 v5 人工智能
摘要
尽管取得了令人鼓舞的成果,最先进的交互式强化学习方案依赖于被动地接收来自顾问专家的监督信号,其形式要么是持续监控,要么是预定义规则,这不可避免地导致繁琐且昂贵的学习过程。本文提出一种新颖的主动式顾问在环的 actor-critic 框架,称为 Ask-AC,其用双向的学习者主动机制取代了单方面的顾问指导机制,从而实现学习者和顾问之间定制化且高效的消息交换。Ask-AC 的核心是两个互补组件,即动作请求器和自适应状态选择器,它们可轻松集成到各种离散 actor-critic 架构中。前者允许智能体在存在不确定状态时主动寻求顾问干预,而后者识别可能被前者遗漏的不稳定状态(尤其在环境变化时),并进而学习在此类状态上促进询问动作。在平稳与非平稳环境以及不同 actor-critic 骨干网络上的实验结果表明,所提框架显著提升了智能体的学习效率,并达到了与持续顾问监控相当的性能。
引用
@article{arxiv.2207.01955,
title = {Ask-AC: An Initiative Advisor-in-the-Loop Actor-Critic Framework},
author = {Shunyu Liu and Kaixuan Chen and Na Yu and Jie Song and Zunlei Feng and Mingli Song},
journal= {arXiv preprint arXiv:2207.01955},
year = {2024}
}
备注
Accepted by IEEE Transactions on Systems, Man and Cybernetics: Systems (TSMC)