中文

基于模糊层次分析法和 DualJudge 的大型语言模型结构化多准则评估

人工智能 2026-04-07 v1

摘要

大型语言模型(LLM)的有效评估仍是一个关键瓶颈,因为常规的直接评分往往导致不一致且难以解释的判断。本文我们将层次分析法(AHP)应用于 LLM 评估,并提出一种信心感知的模糊 AHP(FAHP)扩展,通过 LLM 生成的置信度分数调制三角模糊数来建模认识不确定性。我们在 JudgeBench 上系统验证了该结构化方法,将评估分解为显式准则并纳入不确定性感知的聚合,产生更校准的判断。广泛的实验表明,无论是 crisp 还是模糊 AHP 都一致优于直接评分,在不同模型规模和数据集划分上表现良好,FAHP 在不确定比较情境下表现出优异的稳定性。基于这些洞见,我们提出了受双过程理论启发的混合框架 DualJudge,通过一致性感知加权适度融合直觉性直接评分与结构化 AHP 输出。DualJudge 实现了最佳性能,凸显了直觉性与 deliberative 评估范式的互补优势。这些结果确立了不确定性感知的结构化推理作为通向更可靠 LLM 评估的原则方法。代码已公开于 https://github.com/hreyulog/AHP_llm_judge。

关键词

引用

@article{arxiv.2604.03742,
  title  = {Structured Multi-Criteria Evaluation of Large Language Models with Fuzzy Analytic Hierarchy Process and DualJudge},
  author = {Yulong He and Ivan Smirnov and Dmitry Fedrushkov and Sergey Kovalchuk and Ilya Revin},
  journal= {arXiv preprint arXiv:2604.03742},
  year   = {2026}
}