中文

LLM作为裁判的方法在专家知识任务中评估LLM输出的局限性

人机交互 2024-10-29 v1

摘要

利用大型语言模型(LLM)自身来评估 LLM 输出的潜力,为在各种情境下评估模型性能提供了一种有前景的方法。先前的研究表明,在通用指令遵循的情境下,LLM 作为裁判与人类裁判之间表现出很强的相关性。然而,对于需要专业知识的指令,使用 LLM 作为裁判的有效性仍不确定。在我们的研究中,我们采用了混合方法,进行了成对比较,其中主题专家(SME)和 LLM 均对特定领域任务的输出进行了评估。我们重点关注了两个不同的领域:营养学(由注册营养师专家参与)和心理健康(由临床心理学家专家参与)。我们的结果显示,在评估整体偏好时,营养学领域中 SME 与 LLM 裁判有 68% 的时间达成一致,而在心理健康领域为 64%。此外,结果表明在特定领域的具体问题评估上,SME 与 LLM 的一致性存在差异。我们的发现强调了在评估过程中保留人类专家的重要性,因为仅靠 LLM 可能无法提供复杂、特定知识任务所需的深度理解。我们还探讨了 LLM 评估在不同领域的含义,并讨论了这些见解如何指导评估工作流的设计,以确保交互系统中人类专家与 LLM 之间更好的对齐。

关键词

引用

@article{arxiv.2410.20266,
  title  = {Limitations of the LLM-as-a-Judge Approach for Evaluating LLM Outputs in Expert Knowledge Tasks},
  author = {Annalisa Szymanski and Noah Ziems and Heather A. Eicher-Miller and Toby Jia-Jun Li and Meng Jiang and Ronald A. Metoyer},
  journal= {arXiv preprint arXiv:2410.20266},
  year   = {2024}
}