探索并发挥大型语言模型在 CI/CD 配置翻译中的力量
软件工程
2025-11-04 v1 人工智能
摘要
持续集成 (CI) 是现代协作软件开发的基石,众多 CI 平台可供选择。维护开销、可靠性以及与代码托管平台的集成深度的差异,使得在 CI 平台之间迁移很常见。迁移的核心步骤是翻译 CI 配置,这由于 CI 配置的内在复杂性以及需要理解跨 CI 平台的语义差异和关系而具有挑战。随着大型语言模型 (LLM) 的出现,最近的软件工程进展凸显了其在 CI 配置翻译中的潜力。本文中,我们present了一项关于 LLM 基于 CI 配置翻译的研究,聚焦于从 Travis CI 迁移到 GitHub Actions。首先,我们使用 811 条迁移记录,对所涉及的工作量进行量化,发现开发人员平均阅读 38 行 Travis 配置,写入 58 行 GitHub Actions 配置,其中近半数的迁移需要多个提交。我们进一步分析了四个 LLM 生成的翻译,并识别出 1,121 个问题,归类为四个类别:逻辑不一致 (38%)、平台差异 (32%)、环境错误 (25%)和语法错误 (5%)。最后,我们评估了三种增强策略,表明结合基于指南的提示和迭代细化可实现最佳效果,将构建成功率提升至 75.5%——几乎是 GPT-4o 使用基本提示下的成功率的三倍。
引用
@article{arxiv.2511.01316,
title = {Exploringand Unleashing the Power of Large Language Models in CI/CD Configuration Translation},
author = {Chong Wang and Chen Zhang and Jiajun Wu and Wunan Guo and Jianfeng Qu and Yewen Tian and Yang Liu},
journal= {arXiv preprint arXiv:2511.01316},
year = {2025}
}