用于对齐不当LLM-as-judge的无知识警报
人工智能
2025-09-11 v1 机器学习
摘要
如果我们使用LLM作为评判者来评估其他LLM的复杂决策,那么谁来监控这些评判者?只要我们不知道专家的决策真值且不想信任他们,无限的监控链就不可避免。缓解评估不确定性的一种方法是利用不一致专家之间的逻辑一致性。通过观察LLM评判者在对其他LLM评分时如何一致和不一致,我们可以计算出对其评分能力的唯一可能评估。例如,如果两个LLM评判者就第三个评判者是否正确完成了哪些任务存在分歧,那么他们不可能在判断中都100%正确。这种逻辑可以形式化为整数响应计数空间中的线性规划问题。我们利用它开发了用于检测对齐不当LLM评判者的无知识警报。这些警报可以零误报地检测出评委集合中至少有一名或更多成员违反了用户指定的评分能力要求。
引用
@article{arxiv.2509.08593,
title = {No-Knowledge Alarms for Misaligned LLMs-as-Judges},
author = {Andrés Corrada-Emmanuel},
journal= {arXiv preprint arXiv:2509.08593},
year = {2025}
}
备注
7 pages, 1 figure