中文

面向连续控制的多动作缠结程序图用于多任务强化学习

人工智能 2026-04-29 v1

摘要

过去数十年间,机器学习广泛用于学习复杂任务。强化学习(RL)受人类行为启发,旨在为特定任务开发特定行为,堪称典范。为进一步挑战算法,出现了多任务强化学习(MTRL)环境,要求单个模型学习多个行为。缠结程序图(TPG)算法是一种为离散MTRL环境设计的遗传编程(GP)算法。最近提出了MAPLE算法,作为另一种GP算法,在单任务连续RL环境中取得高业绩。本文提出了TPG的一个变体——多动作TPG(MATPG),其聚合MAPLE智能体并创建控制流程以激活它们。MATPG最初仅在单任务RL环境中测试,达到与MAPLE相当的效果。在本工作中,我们提出了基于Gymnasium MuJoCo Half Cheetah的新基准,该基准包含五个随机位置的障碍物,每个障碍物都要求智能体采取独特行为。该基准作为MATPG的用例,用于证明其作为连续MTRL环境GP解决方案的能力。我们的实验表明,结合 lexicase 选择后,MATPG在该多任务用例中优于现有方法。此外,我们检查了演化图的可解释性,发现该模型的决策流程是完全可解释的。

关键词

引用

@article{arxiv.2604.25369,
  title  = {Multi-action Tangled Program Graphs for Multi-task Reinforcement Learning with Continuous Control},
  author = {Quentin Vacher and Nicolas Beuve and Mickaël Dardaillon and Karol Desnos},
  journal= {arXiv preprint arXiv:2604.25369},
  year   = {2026}
}