适应行动空间和奖励函数变化的强化学习智能体行为
机器学习
2026-01-29 v1 人工智能
摘要
在实际应用中,强化学习(RL)智能体常面临非平稳环境,尤其是在奖励函数变化或可用动作空间扩张时。本文引入 MORPHIN,一个自适应 Q 学习框架,能够在无需完全重新训练的情况下实现即时适应。通过集成概念漂移检测与动态调整学习和探索超参数,MORPHIN 能够适应奖励函数的变化以及智能体动作空间的即时扩张,同时保留先前的策略知识以防止灾难性遗忘。我们使用网格世界基准和交通信号控制仿真进行验证。结果表明,MORPHIN 在收敛速度和持续适应方面优于标准 Q 学习基线,学习效率提升最高可达 1.7 倍。
引用
@article{arxiv.2601.20714,
title = {Adapting the Behavior of Reinforcement Learning Agents to Changing Action Spaces and Reward Functions},
author = {Raul de la Rosa and Ivana Dusparic and Nicolas Cardozo},
journal= {arXiv preprint arXiv:2601.20714},
year = {2026}
}