与何为基准?反事实提示的基线与度量
计算与语言
2026-05-05 v1 机器学习
摘要
反事实提示(即扰动单个因素并测量输出变化)广泛用于评估 LLM 意见偏见和 CoT 忠诚度等问题。但在本工作中,我们认为,在不考虑建立一般模型灵敏度的“意义保持”修改基准的情况下,无法将观察到的效应归因于目标因素。这是因为每一次反事实编辑都是复合处理,捆绑了感兴趣的变量与偶然的表面形式变化;这违反了处理变异无关性。我们观察到在 MedQA 上进行手术性性别改变后,预测翻转率为 14.9%。然而,这在统计上与仅通过改写输入引起的翻转率 (14.1%) 无显著差异。在这种情况下,结论 LLM 对患者性别特别敏感是不成立的。为此,我们提出了一种框架,其中我们通过统计检验比较目标干预观察到的差异与改写输入引起的差异。我们 then 使用该框架重新审视了在 MedPerturb 数据集上进行的分析,该分析报告了模型对患者人口统计特征和风格线索敏感性的证据。我们发现,当考虑一般模型灵敏度时,这些效应大多消失,只有 120 个测试中仅有 5 个达到统计显著性。将同一框架应用于职业传记分类,我们检测到明显的方向性性别偏见,表明该框架即使在效应较小时也能识别出真实的方向性效应。我们评估了各种度量——aggregate、per-sample 分布度量和回归——并发现 per-sample 度量远远优于 aggregate 度量,回归在特征化效应方向和大小方面具有独特优势。
引用
@article{arxiv.2605.01048,
title = {Compared to What? Baselines and Metrics for Counterfactual Prompting},
author = {Zihao Yang and Mosh Levy and Yoav Goldberg and Byron C. Wallace},
journal= {arXiv preprint arXiv:2605.01048},
year = {2026}
}
备注
24 pages, 10 figures. Under review