通过深度隐式模仿强化学习超越专家表现
机器学习
2025-11-06 v1
摘要
模仿学习传统上需要来自最优或近最优专家的完整状态-动作示范。这严重限制了实际应用,因为许多真实场景只提供状态观察而不对应动作,专家性能往往并非最优。本文引入了深度隐式模仿强化学习框架,解决了上述两个限制,通过结合深度强化学习与仅依赖观察数据的隐式模仿学习。我们的主要算法是深度隐式模仿 Q 网络(DIIQN),采用动作推断机制通过在线探索重建专家动作,并集成动态置信机制在专家引导学习与自主学习之间自适应平衡。这使代理能够利用专家指导加速训练,同时保持超越次优专家性能的能力。我们进一步扩展了框架,提出异构动作 DIIQN(HA-DIIQN)算法,以解决专家与代理拥有不同动作集合的场景,这一挑战在隐式模仿学习文献中尚未被 addressed。HA-DIIQN 引入不可行性检测机制和桥接程序,在直接动作复制不可能时识别连接代理能力与专家指导的替代路径。我们的实验结果表明,DIIQN 的每回合总收益比标准 DQN 高出最高 130%,持续优于无法超越专家表现的现有隐式模仿方法。在异构动作设置下,HA-DIIQN 的学习速度比基线快最高 64%,利用了传统方法无法利用的专家数据集。广泛的参数灵敏度分析揭示了该框架在不同数据集大小和超参数配置下的鲁棒性。
引用
@article{arxiv.2511.03616,
title = {Going Beyond Expert Performance via Deep Implicit Imitation Reinforcement Learning},
author = {Iason Chrysomallis and Georgios Chalkiadakis},
journal= {arXiv preprint arXiv:2511.03616},
year = {2025}
}