基于多模型测量的深度学习框架测试方法——启发式指导
软件工程
2025-10-22 v2
摘要
深度学习框架是开发和部署深度学习应用的基础。为提高深度学习框架的质量,研究人员提出了许多测试方法,这些方法使用深度学习模型作为测试输入。然而,现有方法主要将模型的bug检测效果作为启发式指标,存在三个关键局限性。首先,现有方法未对模型算子组合多样性进行量化,可能遗漏能够触发框架bug的关键算子组合。其次,现有方法忽略了对模型执行时间的测量与启发式引导,导致在有限的测试时间内遗漏了大量潜在的模型用于检测更多框架bug。最后,现有方法忽略了不同模型测量之间的相关性,仅依赖单一指标的启发式引导,而不考虑它们之间的权衡。为克服这些局限性,我们提出了DLMMM——首个将多个模型测量纳入启发式引导并通过融合这些测量以实现其权衡的深度学习框架测试方法。DLMMM首先量化测量模型的bug检测性能、算子组合多样性和模型执行时间。随后,DLMMM根据这些测量之间的相关性进行融合,以实现其权衡。为进一步提高测试效果,DLMMM设计了多层次的启发式引导用于测试输入模型的生成。我们将DLMMM应用于测试三个广泛使用的深度学习框架(包括TensorFlow、PyTorch和MindSpore)。实验结果表明,DLMMM在有效性和效率方面均优于最先进的方法。
引用
@article{arxiv.2507.15181,
title = {Deep Learning Framework Testing via Heuristic Guidance Based on Multiple Model Measurements},
author = {Yinglong Zou and Juan Zhai and Chunrong Fang and Yanzhou Mu and Jiawei Liu and Zhenyu Chen},
journal= {arXiv preprint arXiv:2507.15181},
year = {2025}
}