REFLEX:基于大语言模型判断的无参考日志摘要评估
计算与语言
2026-04-21 v2 人工智能
机器学习
软件工程
摘要
由于缺乏高质量的参考摘要以及ROUGE、BLEU等现有指标依赖表层词汇重叠的局限性,评估日志摘要系统颇具挑战性。我们提出REFLEX,这是一种基于大语言模型(LLM)判断的无参考日志摘要评估指标。REFLEX将LLM用作无监督评估器,评估摘要在相关性、信息量和连贯性等维度上的质量,无需金标准参考或人工标注。我们展示了REFLEX在多个日志摘要数据集上 produces stable、可解释且细粒度的评估,并且比传统指标更有效地区分模型输出。REFLEX为在参考数据稀缺或不可用的实际场景中评估日志摘要提供了可扩展的替代方案。
引用
@article{arxiv.2511.07458,
title = {REFLEX: Reference-Free Evaluation of Log Summarization via Large Language Model Judgment},
author = {Priyanka Mudgal},
journal= {arXiv preprint arXiv:2511.07458},
year = {2026}
}
备注
Accepted at IEEE-ICETISI 2025 Code is available at: https://github.com/prmudgal/Reflex