超越准确率:开源深度学习项目单元测试的实证研究
软件工程
2024-02-27 v1 人工智能
摘要
深度学习(DL)模型发展迅速,重点是通过测试模型准确率和鲁棒性来实现高性能。然而,当需要将深度学习项目作为软件系统对待和测试时,尚不清楚这些项目是否经过了彻底的测试或功能是否正确。因此,我们对开源深度学习项目中的单元测试进行了实证研究,分析了来自 GitHub 的 9,129 个项目。我们发现:1) 经过单元测试的深度学习项目与开源项目指标呈正相关,且拉取请求的接受率更高;2) 68% 的抽样深度学习项目完全没有进行单元测试;3) 深度学习模型的层和工具实用程序(utils)拥有最多的单元测试。基于这些发现和先前的研究成果,我们构建了深度学习项目中单元测试与故障之间的映射分类法。我们讨论了这些发现对开发人员和研究人员的启示,并强调了在开源深度学习项目中进行单元测试以确保其可靠性和稳定性的必要性。本研究通过提高社区对深度学习项目中单元测试重要性的认识并鼓励该领域的进一步研究,为该社区做出了贡献。
引用
@article{arxiv.2402.16546,
title = {Beyond Accuracy: An Empirical Study on Unit Testing in Open-source Deep Learning Projects},
author = {Han Wang and Sijia Yu and Chunyang Chen and Burak Turhan and Xiaodong Zhu},
journal= {arXiv preprint arXiv:2402.16546},
year = {2024}
}
备注
ACM Transactions on Software Engineering and Methodology (2023)