中文

利用语言模型进行多语言场景下的日志语句生成: 我们进展如何?

软件工程 2026-05-26 v1

摘要

日志语句捕获了软件维护活动(如测试、调试和故障分析)的关键信息。由于这种重要性,开发人员必须精心设计日志语句,这需要大量的努力。为了支持开发人员,已经提出了各种端到端的自动化日志语句生成方法,而这些方法主要是在单一编程语言环境中进行评估的,它们在多语言环境中的有效性仍未得到充分探索。因此,在本文中,我们比较评估了三种最先进的日志语句生成方法和五个大型语言模型(LLM)在多种编程语言上的表现。为此,我们构建了一个包含五种编程语言、150,000个实例的多语言基准测试。我们的实证结果表明,最先进的方法UniLog实现了最佳的整体性能,即使在多语言环境中也能保持高效。我们还观察到不同语言之间日志生成难度的显著差异:Python提出了更大的挑战,而JavaScript则表现出相对更好的性能。详细分析表明,这些差异源于日志插入分布和特定语言日志习惯用法的变化。我们的发现表明,简单地扩大模型规模或训练数据量不足以实现多语言日志生成;相反,设计针对目标语言特定特征的方法至关重要。这些发现表明,未来的自动化日志记录技术应明确考虑语言特定的日志记录特征,以在多语言软件开发环境中实现稳健的性能。

关键词

引用

@article{arxiv.2605.25374,
  title  = {Leveraging Language Models for Log Statement Generation in Multilingual Scenarios: How Far Are We?},
  author = {Kazuki Kusama and Honglin Shu and Masanari Kondo and Yasutaka Kamei},
  journal= {arXiv preprint arXiv:2605.25374},
  year   = {2026}
}