AUCAD:基于日志相关问题自动构建对齐数据集以提升基于 LLM 的日志生成
软件工程
2025-11-05 v2
摘要
日志语句已成为现代软件系统的重要组成部分。以往的研究工作聚焦于支持日志语句放置决策,例如在何处记录、记录什么内容。随着大语言模型(LLM)在诸如代码补全或生成等代码相关任务中的广泛应用,针对日志语句的自动化生成方法正迎来蓬勃发展。然而,这些方法的实际表现仍有很大提升空间。本文通过针对性地对 LLM 进行后训练,来提升基于 LLM 的自动化日志语句生成性能。因此,本文的首要贡献是一种新方法,称为 AUCAD,它从日志相关问题中提取信息,自动构建此类数据集。长期以来,研究人员注意到,开源社区中相当大比例的 issue 与日志语句有关。然而,从这些数据中提炼出训练数据需要大量的人工工作,这既费时又昂贵,实际操作中难以实现。通过本文提出的方法,我们自动从 88 个项目中 1,537 条日志数据条目中提取日志相关 issue,并识别出 808 个代码片段(即方法),这些代码片段在每个 issue 的修改前后都有可检索的源代码(包括日志语句),以构建数据集。数据集中的每个条目包含一个数据对,分别表示高质量和有问题的日志语句。有了这一数据集,我们对多种 LLM(主要来自 Llama 系列)进行后训练,以实现自动化日志语句生成。人工评估和实验结果均表明,这些模型显著优于现有的基于 LLM 的解决方案,从而验证了我们构建后训练数据集以提升基于 LLM 的日志语句生成性能的方法的有效性。
引用
@article{arxiv.2412.18835,
title = {AUCAD: Automated Construction of Alignment Dataset from Log-Related Issues for Enhancing LLM-based Log Generation},
author = {Hao Zhang and Dongjun Yu and Lei Zhang and Guoping Rong and Yongda Yu and Haifeng Shen and He Zhang and Dong Shao and Hongyu Kuang},
journal= {arXiv preprint arXiv:2412.18835},
year = {2025}
}
备注
In the 16th International Conference on Internetware 2025. 13 pages