中文

进化强化学习中神经与程序化策略的生存动力学

机器学习 2026-01-09 v1

摘要

在进化强化学习任务(ERL)中,代理策略常常编码为小型人工神经网络(NERL),此类表征缺乏显式的模块化结构,限制了行为解释。我们研究whether programmatic policies(PERL),即基于软可微决策列表(SDDL)实现的 PERL,能否匹配NERL的性能。为支持可重复的评估,我们提供了首个完全指定且开源的经典1992年人工生命(ALife)ERL testbed 的重新实现。我们利用 Kaplan-Meier 曲线和受限均值生存时间(RMST)指标进行严格的生存分析,覆盖4000个独立试验——这些指标在原研究中不存在。我们发现PERL与NERL之间存在统计学上的显著生存概率差异。PERL代理平均比NERL代理多存活 201.69 步。此外,使用学习alone(无进化)的SDDL代理平均比同时使用学习和评估的神经代理多存活 73.67 步。这些结果表明,在ALife中,程序化策略可以超过神经策略的生存性能。

关键词

引用

@article{arxiv.2601.04365,
  title  = {Survival Dynamics of Neural and Programmatic Policies in Evolutionary Reinforcement Learning},
  author = {Anton Roupassov-Ruiz and Yiyang Zuo},
  journal= {arXiv preprint arXiv:2601.04365},
  year   = {2026}
}