CARE:面向可靠 LLM 评估的干扰感知聚合
机器学习
2026-03-03 v1 人工智能
机器学习
摘要
LLM 评判器集合是可扩展评估的标准范式,但其聚合机制存在根本性缺陷:它们隐式假设评判器提供对真实质量的独立估计。然而,实际情况下,LLM 评判器因共享潜在干扰因素——例如 verbosity、风格偏好或训练痕迹——而表现出相关误差,导致像多数投票或平均值等标准聚合规则几乎没有收益,甚至可能放大系统性错误。为此,我们引入 CARE,一种干扰感知聚合框架,显式地将 LLM 评判器得分建模为源自潜在真实质量信号和共享干扰因素。我们不依赖 ground-truth 标签,而通过 CARE 将质量与干扰因素分离。我们提供了在共享干扰条件下识别性和有限样本恢复的理论保证,并量化了当聚合模型省略潜在干扰因素时所致的系统性偏差。在覆盖连续评分、二元分类和两两偏好等情形的 12 个公开基准测试中,CARE 改进了聚合准确度,将误差降低最高可达 26.8%。代码已在 \href{https://github.com/SprocketLab/CARE}{https://github.com/SprocketLab/CARE} 上发布。
引用
@article{arxiv.2603.00039,
title = {CARE: Confounder-Aware Aggregation for Reliable LLM Evaluation},
author = {Jitian Zhao and Changho Shin and Tzu-Heng Huang and Satya Sai Srinath Namburi GNVV and Frederic Sala},
journal= {arXiv preprint arXiv:2603.00039},
year = {2026}
}