噪声-响应校准:面向 LLM 判官的因果干预协议
机器学习
2026-03-19 v1
摘要
大型语言模型 (LLM) 越来越被用作自动判官和合成标注器,尤其在标注稀缺的场景中。然而,这些系统是随机的,常常过于自信,这使得在外部真实标签有限的情况下做出部署决策困难。我们提出一种基于受控输入干预的实用校准协议:如果噪声严重程度增加,任务性能应呈现统计显著的恶化趋势。我们使用斜率基假设测试对重复试验进行操作化化处理,针对表格数据使用信噪比 (SNR) 扰动,针对文本数据使用词汇扰动。我们在 UCI 表格基准和四个文本分类数据集上进行实验,发现行为在不同模态中呈现出明显差异。我们的结果揭示了模态差距:尽管基于文本的判官表现出可预测的恶化,但多数表格数据集即使在显著的信噪比降低下也表现出统计显著的性能恶化。有趣的是,我们发现模型在对噪声干预不敏感的数据集上表现较差。我们提供一种可复现的方法和报告协议,用于在分布迁移下对 LLM 判官进行稳健的校准。
引用
@article{arxiv.2603.17172,
title = {Noise-Response Calibration: A Causal Intervention Protocol for LLM-Judges},
author = {Maxim Khomiakov and Jes Frellsen},
journal= {arXiv preprint arXiv:2603.17172},
year = {2026}
}
备注
Published as a conference paper at CAO Workshop at ICLR 2026