中文

GraphNet:用于张量编译器研究的大规模计算图数据集

机器学习 2025-10-29 v1 计算与语言

摘要

我们介绍 GraphNet,这是一个包含 2.7K 个真实世界深度学习计算图的数据集,拥有丰富的元数据,跨越六大任务类别,涵盖多个深度学习框架。为评估张量编译器在这些样本上的性能,我们提出了衡量指标 Speedup Score S(t),该指标综合考虑运行时加速与执行正确性,并可根据可调容忍度水平进行调整,为评估通用优化能力提供可靠度量。进一步地,我们将 S(t)扩展为考虑误差信息的 Error-aware Speedup Score ES(t),帮助编译器开发者识别关键性能瓶颈。在本报告中,我们在计算机视觉(CV)和自然语言处理(NLP)样本上,对默认张量编译器——PaddlePaddle 的 CINN 和 PyTorch 的 TorchInductor 进行基准测试,以演示 GraphNet 的实际应用性。完整的数据集构建管道及图提取和编译器评估工具均已在 https://github.com/PaddlePaddle/GraphNet 提供。

关键词

引用

@article{arxiv.2510.24035,
  title  = {GraphNet: A Large-Scale Computational Graph Dataset for Tensor Compiler Research},
  author = {Xinqi Li and Yiqun Liu and Shan Jiang and Enrong Zheng and Huaijin Zheng and Wenhao Dai and Haodong Deng and Dianhai Yu and Yanjun Ma},
  journal= {arXiv preprint arXiv:2510.24035},
  year   = {2025}
}