中文

单语言证据不足以进行自动化日志记录:多语言基准与 LLM 实证研究

软件工程 2026-04-21 v1

摘要

日志语句是调试、故障诊断和生产可观测性的核心,但编写它们需要开发者决定在何处放置日志语句、使用哪个 API 和严重程度等级,以及暴露什么运行时信息。自动化日志记录旨在减轻这一负担,但现有证据主要来自 Java 为中心的仓库快照数据集,因而尚不清楚关于模型行为和模型选择的结论是否在编程语言生态系统中普遍适用,或是否适用于真实代码演化情境。本文提出 MultiLogBench,一个涵盖六种编程语言生态系统的多语言基准和实证研究。MultiLogBench 包含63,965 份生产代码仓库快照实例、744 份修订历史案例,其中开发者在维护期间引入日志语句,以及一套用于鲁棒性分析的配对转换修订历史分支。我们在统一协议下评估了七个当代大语言模型,涵盖日志站点定位、框架锚定匹配、严重程度预测、消息生成、变量恢复和级联整体质量。结果显示清晰的跨语言差异:框架锚定匹配是最受语言敏感的组成部分,循环和嵌套调用站是最难的结构化情境,模型排名仅在顶级 tier 中保持稳定。这些模式在粗略层面上在修订历史数据中仍然存在,而转换输入并未导致广泛的同向性能崩溃。总体而言,MultiLogBench 表明,关于自动化日志记录的稳健论断需要多语言评估和以维护为导向的验证。

关键词

引用

@article{arxiv.2604.17529,
  title  = {Single-Language Evidence Is Insufficient for Automated Logging: A Multilingual Benchmark and Empirical Study with LLMs},
  author = {Renyi Zhong and Yichen Li and Yulun Wu and Jinxi Kuang and Yintong Huo and Michael R. Lyu},
  journal= {arXiv preprint arXiv:2604.17529},
  year   = {2026}
}