基于脑源性强化学习的演化防御:用于保护误配置软件应用的移动目标策略
机器学习
2026-04-17 v1 人工智能
摘要
软件系统中的不当配置常常会创建漏洞,使其暴露于攻击之下。静态架构会加剧这一问题,允许误配置持续存在,为攻击者在攻击期间提供利用机会。为应对这一挑战,可以应用一种称为移动目标防御 (MTD) 的动态主动防御策略。MTD 持续更改系统的攻击面,从而遏制潜在威胁。在先前的研究中,我们开发了一个针对单人 MTD 游戏模型的概念验证,称为 RL-MTD,使用强化学习 (RL) 生成动态安全配置。虽然该模型在生成安全配置方面表现令人满意,但它面临搜索空间非优化和稀疏的问题,导致性能下降。为解决这一障碍,本文通过利用两种仿生搜索算法:遗传算法 (GA) 和粒子群优化 (PSO),来解决搜索空间优化问题。此外,我们将这些算法整合到基本 RL-MTD 模型中,创建了PSO-RL 和 GA-RL。我们在四个误配置被测系统 (SUT) 上比较了三种模型:基本 RL-MTD、GA-RL 和 PSO-RL 的性能,评估其生成最安全配置的能力。结果表明,来自 GA-RL 和 PSO-RL 获得的最优搜索空间显著提高了基本 RL-MTD 模型的性能,而该模型则是没有优化搜索空间的版本。尽管 GA-RL 和 PSO-RL 都表现出色的搜索能力,但 PSO-RL 在大多数 SUT 上略胜于 GA-RL。总体而言,两种算法都在寻找最优搜索空间方面表现出色,这反过来又提高了模型在生成最优安全配置方面的性能。
引用
@article{arxiv.2504.09463,
title = {Comorbidity-Informed Transfer Learning for Neuro-developmental Disorder Diagnosis},
author = {Xin Wen and Shijie Guo and Wenbo Ning and Rui Cao and Jie Xiang and Xiaobo Liu and Jintai Chen},
journal= {arXiv preprint arXiv:2504.09463},
year = {2026}
}