CAT:一个在受控输入变化下分析LLM一致性-准确性关系的度量驱动框架
计算与语言
2026-01-01 v1
摘要
我们引入了 \textsc{CAT},一个旨在评估和可视化大型语言模型(LLM)在可控输入变化下准确性与响应一致性之间相互作用的框架,以多选题(MC)基准作为案例研究。当前的评估实践主要关注模型能力(如准确性或基准分数),且最近测量一致性被认为是将LLM部署于高风险现实应用中的一个基本属性。我们在本文中论证,尽管这两个维度仍应独立评估,但为了对LLM进行更细致的评估,也需要考虑它们的相互依赖性。\textsc{CAT} 的核心是一致性-准确性关系(CAR)曲线,该曲线可视化了模型准确性如何随着由最小一致性准确性(MCA)度量定义的递增一致性要求而变化。我们进一步提出了一致性导向鲁棒性估计(CORE)指数,这是一个结合CAR曲线面积和形状的全局度量,用于量化准确性与一致性之间的权衡。我们在多种通用和领域特定的LLM上展示了我们框架的实践演示,并在多个MC基准上进行了评估。我们还概述了 \textsc{CAT} 如何扩展到MC任务之外,通过可适应的评分函数支持长篇开放式评估。
引用
@article{arxiv.2512.23711,
title = {CAT: A Metric-Driven Framework for Analyzing the Consistency-Accuracy Relation of LLMs under Controlled Input Variations},
author = {Paulo Cavalin and Cassia Sanctos and Marcelo Grave and Claudio Pinhanez and Yago Primerano},
journal= {arXiv preprint arXiv:2512.23711},
year = {2026}
}