通过可验证的全局解释解释 LLM 评判政策
计算与语言
2025-10-10 v1 人工智能
摘要
使用 LLM 进行文本评估,即 LLM 作为评判员,是日益增长地被大规模使用以增强或甚至取代人工注释。因此,必须理解这背后潜在的偏见和风险。本文提出了一种从 LLM 评判中提取高水平概念基础全局政策的方法。我们的方法包括两个算法:1)CLoVE(Contrastive Local Verifiable Explanations),生成可验证的、基于概念的、对比的局部解释;2)GloVE(Global Verifiable Explanations),使用迭代聚类、总结和验证将局部规则浓缩为全局政策。我们在用于内容损害检测的七个标准基准数据集上评估了 GloVE。我们发现提取的全局政策对 LLM 评判的决定具有高度忠实度。此外,我们评估了全局政策对文本扰动和对抗性攻击的鲁棒性。最后,我们进行了用户研究,以评估用户对全局政策的理解和满意度。
引用
@article{arxiv.2510.08120,
title = {Interpreting LLM-as-a-Judge Policies via Verifiable Global Explanations},
author = {Jasmina Gajcin and Erik Miehling and Rahul Nair and Elizabeth Daly and Radu Marinescu and Seshu Tirupathi},
journal= {arXiv preprint arXiv:2510.08120},
year = {2025}
}
备注
12 pages, 2 figures, 3 tables