中文

面向安全强化学习中的最优控制的自组织双缓冲自适应聚类经验回放 (SODACER)

系统与控制 2026-04-14 v2 人工智能 机器学习 机器人学 系统与控制 最优化与控制

摘要

本文提出一种新颖的强化学习框架,命名为自组织双缓冲自适应聚类经验回放 (SODACER),旨在实现非线性系统的安全可扩展最优控制。该框架包含用于快速适应最近经验的快速缓冲区,以及采用自组织自适应聚类机制以维护多样且非冗余历史经验的慢速缓冲区。自适应聚类机制会动态剔除冗余样本,优化内存效率,同时保留关键环境模式。该方法将SODACER与控制屏障函数 (CBF) 集成,以在整个学习过程中强制执行状态和输入约束,确保安全性。为增强收敛性和稳定性,框架结合了 Sophia 优化器,实现自适应二阶梯度更新。所提出的 SODACER-Sophia 架构确保在动态安全关键环境中实现可靠、有效且稳健的学习,为机器人、医疗和大规模系统优化等应用提供通用解决方案。该方法在一个具有多个控制输入和安全约束的非线性人乳头瘤病毒 (HPV) 传播模型上进行验证。与随机和基于聚类的经验回放方法进行比较评估表明,SODACER 达到了更快的收敛速度、更好的样本效率以及更优的偏差-方差权衡,同时维持安全的系统轨迹,经 Friedman 检验验证。

关键词

引用

@article{arxiv.2601.06540,
  title  = {Self-Organizing Dual-Buffer Adaptive Clustering Experience Replay (SODACER) for Safe Reinforcement Learning in Optimal Control},
  author = {Roya Khalili Amirabadi and Mohsen Jalaeian Farimani and Omid Solaymani Fard},
  journal= {arXiv preprint arXiv:2601.06540},
  year   = {2026}
}

备注

Published in Nature Scientific Reports (2026)