幽灵策略:深入强化学习失败的新范式
人工智能
2025-06-17 v1
摘要
深度强化学习(DRL)代理往往表现出难以理解、调试和从中学习的复杂失效模式。这种不透明性阻碍了其在实际应用中的可靠部署。为此,我们引入了``幽灵策略''(Ghost Policies)的概念,通过Arvolution实现,该概念是一种新的增强现实(AR)框架。Arvolution将代理历史失败策略轨迹渲染为与活跃代理在空间和时间上共存的半透明``幽灵'',从而实现对策略发散的直观可视化。Arvolution独特地集成了:(1)幽灵策略的AR可视化,(2)DRL不适应行为分类学,(3)用于系统性人类干扰以科学研究失效的协议,以及(4)双重学习循环,人类和代理均从这些可视化的失败中学习。我们提出了范式转变,将DRL代理的失败从不可见、代价高昂的错误转化为宝贵、可操作的学习资源,为新的研究领域``失效可视化学习''奠定了基础。
引用
@article{arxiv.2506.12366,
title = {Ghost Policies: A New Paradigm for Understanding and Learning from Failure in Deep Reinforcement Learning},
author = {Xabier Olaz},
journal= {arXiv preprint arXiv:2506.12366},
year = {2025}
}