中文

PerfGen:面向大数据分析的自动性能基准生成

软件工程 2024-12-09 v1

摘要

大数据分析中许多性能问题的症状,如计算偏斜、数据偏斜和内存偏斜,都与输入数据相关。然而,由于缺乏能够触发此类性能症状的输入,难以调试和测试大数据分析系统。我们设计 PerfGen 以自动生成用于性能测试的输入。PerfGen 克服了在性能测试中直观使用自动模糊测试的三个挑战:首先,典型的灰盒模糊测试依赖覆盖率作为引导信号,难以触发有趣的性能行为。因此,PerfGen 提供可扩展的用户自定义性能监控模板,作为灰盒模糊测试的引导指标。其次,性能症状可能出现在大数据分析管道的中间或后期阶段。因此,PerfGen 采用分阶段模糊测试方法:首先识别中间阶段导致症状的输入,然后通过大语言模型生成的伪逆函数将其转换为程序开头的输入。最后,PerfGen 定义一组受偏斜启发的输入变异方案,提高诱发性能问题的概率。我们对 PerfGen 进行了四项案例研究评估。PerfGen 在生成触发性能症状的输入方面相较于传统模糊测试方法 achieves至少 11 倍的加速。此外,识别中间输入并转换为原始输入的能力使 PerfGen 能在不到 0.004% 迭代次数的基线方法所需时间内生成此类工作负载。

关键词

引用

@article{arxiv.2412.04687,
  title  = {PerfGen: Automated Performance Benchmark Generation for Big Data Analytics},
  author = {Jiyuan Wang and Jason Teoh and Muhammand Ali Gulza and Qian Zhang and Miryung Kim},
  journal= {arXiv preprint arXiv:2412.04687},
  year   = {2024}
}