中文

LLM-as-Judge评估在解释性回应中的可信度?对定性研究工作流程的启示

计算与语言 2026-04-02 v1 人工智能

摘要

随着定性研究者越来越关注利用自动化工具支持解释性分析,大语言模型(LLM)常被直接引入分析工作流程,而未系统评估解释性质量或跨模型比较。这种做法使模型选择基本未被检视,尽管其可能影响解释性结果。为填补这一空白,本研究检讨LLM-as-judge评估是否与人类对解释性质量的判断相吻合,并能为模型层面的决策提供指导。我们使用来自K-12数学教师半结构化访谈的712段对话文本,生成五个广泛使用的推理模型的单句解释性回应:Command R+(Cohere)、Gemini 2.5 Pro(Google)、GPT-5.1(OpenAI)、Llama 4 Scout-17B Instruct(Meta)和Qwen 3-32B Dense(Alibaba)。在五个指标上进行自动评估,使用AWS Bedrock的LLM-as-judge框架,对样本子集的回应由经过培训的人类评估者独立评估解释性准确性、细腻性保存和解释性连贯性。结果表明,LLM-as-judge得分在模型层面捕捉了人类评估的广泛趋势,但在得分幅度上存在显著差异。在自动化指标中,连贯性(Coherence)与汇总的人类评分呈现最强一致性,而忠实性(Faithfulness)和正确性(Correctness)在段落层面显示出系统性不匹配,尤其是针对非文字和细腻的解释。安全相关指标与解释性质量基本无关。这些发现表明,LLM-as-judge方法更适合作为筛选或淘汰表现不佳模型的手段,而不宜取代人类判断,为定性研究工作流程中的系统性比较与模型选择提供了实用指导。

关键词

引用

@article{arxiv.2604.00007,
  title  = {Dynin-Omni: Omnimodal Unified Large Diffusion Language Model},
  author = {Jaeik Kim and Woojin Kim and Jihwan Hong and Yejoon Lee and Sieun Hyeon and Mintaek Lim and Yunseok Han and Dogeun Kim and Hoeun Lee and Hyunggeun Kim and Jaeyoung Do},
  journal= {arXiv preprint arXiv:2604.00007},
  year   = {2026}
}

备注

Project Page: https://dynin.ai/omni/