LLM-as-Judge 评估在解释性回应中的可靠性?对定性研究工作流程的启示
计算与语言
2026-04-02 v1 人工智能
摘要
随着定性研究者越来越多地使用自动化工具来支持解释性分析,大语言模型(LLM)常被直接引入分析工作流程,而无系统评估解释性质量或跨模型比较的评估。这种做法使模型选择几乎未受到检讦,尽管其可能对解释性结果产生重要影响。为弥补这一差距,本研究检讨 LLM-as-judge 评估是否与人类对解释性质量的判断保持有意义的一致性,并能为模型层面的决策提供依据。我们使用来自 K-12 数学教师半结构化访谈的 712 条对话性文本,生成了来自五个广泛使用的推理模型(Command R+(Cohere)、Gemini 2.5 Pro(Google)、GPT-5.1(OpenAI)、Llama 4 Scout-17B Instruct(Meta)和 Qwen 3-32B Dense(Alibaba))的单句解释性回应。采用 AWS Bedrock 的 LLM-as-judge 框架进行自动评估,涵盖五个指标;对部分回应进行分层抽样,由经过培训的人类评估者独立对解释准确性、细微差异保留和解释连贯性进行评分。结果表明,LLM-as-judge 分数在模型层面捕捉到人类评估的总体方向性趋势,但在分数大小方面存在显著偏差。在自动化指标中,连贯性(Coherence)与聚合的人类评分呈现最强一致性,而忠实性(Faithfulness)和正确性(Correctness)在文本级别显示出系统性偏离,尤其针对非文字化和细微解释。在安全相关指标方面,与解释性质量关系不大。这些发现表明,LLM-as-judge 方法更适合作为筛选或淘汰表现不佳模型的手段,而不宜取代人类判断。这为定性研究工作流程中的 LLM 系统比较与选择提供了实践性指导。
关键词
引用
@article{arxiv.2604.00008,
title = {How Trustworthy Are LLM-as-Judge Ratings for Interpretive Responses? Implications for Qualitative Research Workflows},
author = {Songhee Han and Jueun Shin and Jiyoon Han and Bung-Woo Jun and Hilal Ayan Karabatman},
journal= {arXiv preprint arXiv:2604.00008},
year = {2026}
}