RCScore: 量化大型语言模型中的响应一致性
计算与语言
2025-10-31 v1
摘要
当前的大型语言模型评估通常依赖单一指令模板,忽略了模型对指令风格的敏感性——这在实际部署中是至关重要的。我们提出了 RCScore,一个多维框架,用于量化指令表述如何影响模型响应。通过系统性地将基准问题转化为多种指令风格,RCScore 揭示了传统指标未能检测到的性能变异。我们在四个推理基准测试中对十个大型语言模型进行实验,表明指令风格可以使准确度变化高达 16.7 个百分点。我们引入了跨响应相似性(Cross-Response Similarity,CRS),一种将 RCScore 指标应用于衡量风格自我一致性的方法,并建立了其与任务准确性之间的强相关性,表明一致性是衡量模型可靠性的有价值指标。额外发现表明,确定性解码会产生更具风格稳定性的输出,模型规模与跨风格一致性呈正相关。RCScore 提供了一个原则化的方法,用于评估指令鲁棒性。
引用
@article{arxiv.2510.26193,
title = {RCScore: Quantifying Response Consistency in Large Language Models},
author = {Dongjun Jang and Youngchae Ahn and Hyopil Shin},
journal= {arXiv preprint arXiv:2510.26193},
year = {2025}
}