中文

我不能共享代码,但我需要翻译——基于联邦大语言模型的代码翻译实证研究

软件工程 2025-01-13 v1

摘要

由于技术和项目需求的快速演变,组织需要将其软件项目中的代码库升级到编程语言的新版本,甚至翻译成全新的语言。然而,代码翻译是资源密集型的,并且需要源语言和目标语言的专业知识。虽然研究人员在自动化传统语言与现代语言之间的翻译方面取得了进展,但最近的工作越来越多地转向预训练的大语言模型(LLM)以实现高效翻译。鉴于代码的专有性质,组织更倾向于在本地微调LLM,而不是依赖外部API。这是首批提出基于联邦LLM的代码翻译方法的实证研究之一。所提出的方法使客户端能够在不共享敏感数据的情况下联合训练代码翻译器。本研究表明,参与者可以协作开发一个FedLLM,用于高效的代码翻译(特别是C#到Java及其反向翻译),与单个客户端模型相比,取得了优越的结果(CodeLLaMA的CodeBLEU分数提高了40%以上)。我们的发现表明,FedLLM提供了一种协作式的代码翻译方法,并可能成为该领域未来研究的一个有前景的方向。

关键词

引用

@article{arxiv.2501.05724,
  title  = {I Can't Share Code, but I need Translation -- An Empirical Study on Code Translation through Federated LLM},
  author = {Jahnavi Kumar and Venkata Lakshmana Sasaank Janapati and Mokshith Reddy Tanguturi and Sridhar Chimalakonda},
  journal= {arXiv preprint arXiv:2501.05724},
  year   = {2025}
}

备注

10 pages