中文

MCJudgeBench:多约束指令遵循中约束级评判评估基准

计算与语言 2026-05-06 v1 人工智能

摘要

多约束指令遵循要求验证响应是否满足多个独立要求,然而 LLM 评判器通常仅通过整体响应评判进行评估。我们提出 MCJudgeBench,一个用于多约束指令遵循中约束级评判评估的基准。每个实例包含一条指令、一个候选响应、一个显式约束列表、各约束的金标准标签 {yes, partial, no},以及受控的响应端扰动。评估协议进一步包含评估提示词变体,以测试评判器的稳定性。我们使用正确性和不一致性指标评估专有和开源 LLM 评判器,区分随机解码下的内在不一致性与提示词和响应扰动下的程序性不一致性。我们的结果表明,评判器的可靠性具有多个维度:强劲的整体性能并不能保证在各个标签类别上具有同样可靠的检测能力,尤其是对于较少出现的 partial 和 no 情况。正确性较高的评判器并不总是具有较低的不一致性。带有推理的评估提高了正确性,但并未统一提高稳定性。这些发现促使在约束级评估 LLM 评判器以研究这些失败模式。

关键词

引用

@article{arxiv.2605.03858,
  title  = {MCJudgeBench: A Benchmark for Constraint-Level Judge Evaluation in Multi-Constraint Instruction Following},
  author = {Jaeyun Lee and Junyoung Koh and Zeynel Tok and Hunar Batra and Ronald Clark},
  journal= {arXiv preprint arXiv:2605.03858},
  year   = {2026}
}

备注

GEM Workshop at ACL 2026