中文

利用LLM进行遗留代码现代化:LLM生成文档的挑战与机遇

机器学习 2024-11-25 v1 软件工程

摘要

遗留软件系统使用过时的语言(如MUMPS和主帧汇编)存在效率、维护、人员和安全等方面的挑战。虽然LLM为现代化这些系统提供了前景,但其理解遗留语言的能力尚不为人知。本文研究了利用LLM为遗留代码生成文档的应用。我们使用两个数据集进行研究:一个使用MUMPS编写的电子健康记录(EHR)系统和使用IBM主帧汇编语言代码(ALC)的开源应用程序。我们提出了一种用于生成行级代码注释的提示策略,并设计了评估其完整性、可读性、实用性和幻觉的评估标准。我们的研究评估了人类评估与自动化指标(如代码复杂度和参考基准指标)之间的相关性。我们发现,针对MUMPS和ALC的LLM生成注释通常无幻觉、完整、可读且实用,尽管ALC存在挑战。然而,没有任何自动化指标与注释质量强相关,以用于预测或衡量LLM性能。我们的结果突显了当前自动化措施的局限性,以及为LLM在遗留系统中生成文档而需要更好评估指标的需求。

关键词

引用

@article{arxiv.2411.14971,
  title  = {Leveraging LLMs for Legacy Code Modernization: Challenges and Opportunities for LLM-Generated Documentation},
  author = {Colin Diggs and Michael Doyle and Amit Madan and Siggy Scott and Emily Escamilla and Jacob Zimmer and Naveed Nekoo and Paul Ursino and Michael Bartholf and Zachary Robin and Anand Patel and Chris Glasz and William Macke and Paul Kirk and Jasper Phillips and Arun Sridharan and Doug Wendt and Scott Rosen and Nitin Naik and Justin F. Brunelle and Samruddhi Thaker},
  journal= {arXiv preprint arXiv:2411.14971},
  year   = {2024}
}

备注

Abbreviated version submitted to LLM4Code 2025 (a workshop co-located with ICSE 2025), 13 pages, 3 figures