MDPFuzz 策略测试(可重复性研究)
软件工程
2025-02-27 v1
摘要
近年来,随着强化学习取得的巨大成就,越来越多的人关注用于顺序决策的机器学习模型。伴随这些科学突破和进步,研究者开发了自动功能测试方法,以发现黑箱马尔可夫决策过程中的故障。Pang等人(ISSTA 2022)提出了一种黑箱模糊测试框架MDPFuzz。该方法的主要特点是使用高斯混合模型(GMM)计算测试输入的覆盖率,作为其结果是否已被观察到的可能性。这种通过覆盖率评估的引导旨在促进测试中的新颖性和故障发现。Pang等人通过四个案例评估了他们的工作,比较有无GMM引导的12小时测试活动中发现的故障数量(消融研究)。本文我们验证了原文的一些关键发现,并通过复制和复制研究探讨了MDPFuzz的局限性。我们重新实现了该方法,并在大规模研究中进行评估,将原来的四个案例扩展为三个新的案例。此外,我们将MDPFuzz及其消融版与随机测试基线进行比较。我们还评估了不同参数下覆盖率引导的有效性,这在原来的评估中尚未完成。尽管进行了参数分析并且与Pang等人的原始结论不同,我们发现在大多数情况下,所述消融Fuzzer反而优于MDPFuzz,并得出结论,该提出的覆盖率模型并不导致发现更多故障。
引用
@article{arxiv.2502.19116,
title = {Policy Testing with MDPFuzz (Replicability Study)},
author = {Quentin Mazouni and Helge Spieker and Arnaud Gotlieb and Mathieu Acher},
journal= {arXiv preprint arXiv:2502.19116},
year = {2025}
}
备注
Author's version. 12 pages, 7 figures