MDPFuzz:求解马尔可夫决策过程模型的模糊测试
软件工程
2023-04-13 v4 机器学习
摘要
马尔可夫决策过程(MDP)为建模序列决策问题提供了数学框架,其中许多问题对安全至关重要,如自动驾驶和机器人控制。人工智能研究的快速发展产生了求解 MDP 的高效方法,如深度神经网络(DNN)、强化学习(RL)和模仿学习(IL)。然而,这些流行的求解 MDP 的模型既未经充分测试,也不够严格可靠。我们提出 MDPFuzz,首个面向求解 MDP 模型的黑盒模糊测试框架。MDPFuzz 通过检查目标模型是否进入异常和危险状态来构造测试预言。在模糊测试过程中,MDPFuzz 通过衡量变异状态是否能降低累积奖励或形成新的状态序列来决定保留哪些变异状态。我们设计高效技术,使用高斯混合模型(GMM)和动态期望最大化(DynEM)来量化状态序列的“新颖度”。我们还通过估计目标模型在状态上的局部敏感性,优先处理具有高崩溃揭示潜力的状态。MDPFuzz 在五个求解 MDP 的先进模型上评估,包括监督 DNN、RL、IL 和多智能体 RL。我们的评估涵盖自动驾驶、飞机防撞以及两个常用来基准测试 RL 的游戏场景。在 12 小时运行中,我们在每个模型上发现超过 80 个触发崩溃的状态序列。我们展示了启发性发现:触发崩溃的状态虽看似正常,但与正常状态相比诱发了不同的神经元激活模式。我们进一步开发异常行为检测器以加固所有受评估模型,并利用 MDPFuzz 的发现对其进行修复,在保持精度不变的同时显著增强其鲁棒性。
引用
@article{arxiv.2112.02807,
title = {MDPFuzz: Testing Models Solving Markov Decision Processes},
author = {Qi Pang and Yuanyuan Yuan and Shuai Wang},
journal= {arXiv preprint arXiv:2112.02807},
year = {2023}
}