中文

基于软混合专家的强化学习在有向控制合成中的鲁棒探索

人工智能 2026-02-24 v1 机器学习

摘要

即时有向控制合成(OTF-DCS)通过逐步探索系统来缓解状态空间爆炸,严重依赖探索策略以高效引导搜索。最近的强化学习(RL)方法学习此类策略并实现了从小规模训练实例到更大未见规模的零样本泛化。然而,一个根本性局限是各向异性泛化,即 RL 策略在领域参数空间的特定区域表现强劲,却在其他区域脆弱,由于训练随机性和轨迹相关偏差。这一限制使得方法难以在实际应用中稳健地处理参数变化。为此,我们提出一种软混合专家框架,将多个 RL 专家通过先验置信门控机制组合起来,并将这些各向异性行为视为互补的特殊化。在空中交通基准测试上评估显示,Soft-MoE 显著扩展可求解的参数空间,较任何单个专家在鲁棒性方面都有所提升。

关键词

引用

@article{arxiv.2602.19244,
  title  = {Robust Exploration in Directed Controller Synthesis via Reinforcement Learning with Soft Mixture-of-Experts},
  author = {Toshihide Ubukata and Zhiyao Wang and Enhong Mu and Jialong Li and Kenji Tei},
  journal= {arXiv preprint arXiv:2602.19244},
  year   = {2026}
}