中文

深度学习模型转换器中的故障与风险分析:以ONNX生态系统为例

软件工程 2024-09-04 v4 机器学习

摘要

软件工程师使用多种开发框架和运行时环境来开发、微调并部署深度学习(DL)模型。DL模型转换器在框架之间以及向运行时环境迁移模型。转换错误会损害模型质量并中断部署。然而,DL模型转换器的故障特征尚属未知,这为使用DL互操作技术增添了风险。本文分析了DL模型转换器中的故障。我们调查了软件工程师关于DL互操作工具、用例及痛点的看法(N=92)。随后,我们刻画了与主要互操作工具ONNX相关的模型转换器故障特征(PyTorch和TensorFlow中N=200个问题)。最后,我们提出并检验了关于所研究故障结构性原因的两个假设。我们发现,模型转换器的节点转换阶段约占缺陷的75%,且33%的 reported failure 与语义不正确的模型有关。语义不正确模型的成因难以捉摸,但行为不一致的模型共享算子序列。我们的结果激励未来关于使DL互操作软件更易于维护、扩展和验证的研究。对行为容差与架构覆盖度量的研究可能是富有成果的。

关键词

引用

@article{arxiv.2303.17708,
  title  = {Analysis of Failures and Risks in Deep Learning Model Converters: A Case Study in the ONNX Ecosystem},
  author = {Purvish Jajal and Wenxin Jiang and Arav Tewari and Erik Kocinare and Joseph Woo and Anusha Sarraf and Yung-Hsiang Lu and George K. Thiruvathukal and James C. Davis},
  journal= {arXiv preprint arXiv:2303.17708},
  year   = {2024}
}

备注

[ISSTA'24] Proceedings of the 33rd ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA) 2024