中文

通过可验证的全局解释解释 LLM 评判政策

计算与语言 2025-10-10 v1 人工智能

摘要

使用 LLM 进行文本评估,即 LLM 作为评判员,是日益增长地被大规模使用以增强或甚至取代人工注释。因此,必须理解这背后潜在的偏见和风险。本文提出了一种从 LLM 评判中提取高水平概念基础全局政策的方法。我们的方法包括两个算法:1)CLoVE(Contrastive Local Verifiable Explanations),生成可验证的、基于概念的、对比的局部解释;2)GloVE(Global Verifiable Explanations),使用迭代聚类、总结和验证将局部规则浓缩为全局政策。我们在用于内容损害检测的七个标准基准数据集上评估了 GloVE。我们发现提取的全局政策对 LLM 评判的决定具有高度忠实度。此外,我们评估了全局政策对文本扰动和对抗性攻击的鲁棒性。最后,我们进行了用户研究,以评估用户对全局政策的理解和满意度。

关键词

引用

@article{arxiv.2510.08120,
  title  = {Interpreting LLM-as-a-Judge Policies via Verifiable Global Explanations},
  author = {Jasmina Gajcin and Erik Miehling and Rahul Nair and Elizabeth Daly and Radu Marinescu and Seshu Tirupathi},
  journal= {arXiv preprint arXiv:2510.08120},
  year   = {2025}
}

备注

12 pages, 2 figures, 3 tables