齐蒙-木爬:用于顺序到并行代码翻译的互监督学习
软件工程
2025-10-23 v2 机器学习
摘要
GPU-based高性能计算(HPC)的兴起推动了并行编程模型(如CUDA)的广泛采用。然而,平行编程的内在复杂性导致对自动化顺序到并行方法的需求。然而,数据稀缺是基于机器学习的顺序到并行代码翻译面临的重大挑战。尽管最近的回译方法显示出前景,但仍未能确保翻译后的代码在功能上等价。在本文中,我们提出了齐蒙-木爬(QiMeng-MuPa),一个新的互监督学习框架,用于顺序到并行代码翻译,以解决功能等价性问题。齐蒙-木爬由两个模型组成:翻译器和测试器。通过由共验证和共演化步骤构成的迭代循环,翻译器和测试器相互为彼此生成数据并集体改进。测试器生成单元测试以验证和筛选功能等价的翻译代码,从而演化翻译器,而翻译器生成的翻译代码作为增强输入来演化测试器。实验结果表明,齐蒙-木爬显著提升了基础模型的性能:当应用于Qwen2.5-Coder时,不仅将Pass@1提高了最高可达28.91%,测试器性能提升68.90%,还在BLEU和CodeBLEU分数上分别超过了以前的最先进方法CodeRosetta 1.56和6.92分,同时在DeepSeek-R1和GPT-4.1上实现了相当的性能。我们的代码可在https://github.com/kcxain/mupa上获取。
引用
@article{arxiv.2506.11153,
title = {QiMeng-MuPa: Mutual-Supervised Learning for Sequential-to-Parallel Code Translation},
author = {Changxin Ke and Rui Zhang and Shuo Wang and Li Ding and Guangli Li and Yuanbo Wen and Shuoming Zhang and Ruiyuan Xu and Jin Qin and Jiaming Guo and Chenxi Wang and Ling Li and Qi Guo and Yunji Chen},
journal= {arXiv preprint arXiv:2506.11153},
year = {2025}
}
备注
Accepted to NeurIPS'2025