ConCISE:用于评估大语言模型生成答案简洁性的无参考指标
计算与语言
2026-03-13 v2 人工智能
摘要
大型语言模型(LLM)常常生成冗长、啰嗦的响应,包含冗余或不必要的细节。这降低了清晰度和用户满意度,也增加了模型开发者的成本,尤其是那些按输出 token 数收费的知名专有模型。本文介绍一种用于评估LLM生成响应简洁性的新型无参考指标。该方法在不依赖黄金标准参考答案的情况下量化非本质内容,并计算三项计算的平均值:i) 原始响应与LLM抽象摘要之间的压缩比;ii) 原始响应与LLM抽取式摘要之间的压缩比;iii) 单词删除压缩,其中LLM会尽可能多地删除响应中的非本质单词以保持其意义,删除的 token 数即为简洁度得分。实验结果表明,所提出的指标能够识别LLM输出中的冗余内容,为无需人工标注的 conversational AI 系统自动评估响应简短性提供了实用工具。
引用
@article{arxiv.2511.16846,
title = {ConCISE: A Reference-Free Conciseness Evaluation Metric for LLM-Generated Answers},
author = {Seyed Mohssen Ghafari and Ronny Kol and Juan C. Quiroz and Nella Luan and Monika Patial and Chanaka Rupasinghe and Herman Wandabwa and Luiz Pizzato},
journal= {arXiv preprint arXiv:2511.16846},
year = {2026}
}