中文

CAT:一个在受控输入变化下分析LLM一致性-准确性关系的度量驱动框架

计算与语言 2026-01-01 v1

摘要

我们引入了 \textsc{CAT},一个旨在评估和可视化大型语言模型(LLM)在可控输入变化下准确性与响应一致性之间相互作用的框架,以多选题(MC)基准作为案例研究。当前的评估实践主要关注模型能力(如准确性或基准分数),且最近测量一致性被认为是将LLM部署于高风险现实应用中的一个基本属性。我们在本文中论证,尽管这两个维度仍应独立评估,但为了对LLM进行更细致的评估,也需要考虑它们的相互依赖性。\textsc{CAT} 的核心是一致性-准确性关系(CAR)曲线,该曲线可视化了模型准确性如何随着由最小一致性准确性(MCA)度量定义的递增一致性要求而变化。我们进一步提出了一致性导向鲁棒性估计(CORE)指数,这是一个结合CAR曲线面积和形状的全局度量,用于量化准确性与一致性之间的权衡。我们在多种通用和领域特定的LLM上展示了我们框架的实践演示,并在多个MC基准上进行了评估。我们还概述了 \textsc{CAT} 如何扩展到MC任务之外,通过可适应的评分函数支持长篇开放式评估。

关键词

引用

@article{arxiv.2512.23711,
  title  = {CAT: A Metric-Driven Framework for Analyzing the Consistency-Accuracy Relation of LLMs under Controlled Input Variations},
  author = {Paulo Cavalin and Cassia Sanctos and Marcelo Grave and Claudio Pinhanez and Yago Primerano},
  journal= {arXiv preprint arXiv:2512.23711},
  year   = {2026}
}