中文

EasyJudge:一个用于LLM响应综合评估的易用工具

人工智能 2024-10-15 v1 计算与语言

摘要

最近,使用大型语言模型(LLM)来评判其他LLM质量已成为一种日益增长的趋势。许多研究采用闭源模型,主要使用GPT-4作为评估器。然而,由于GPT-4模型的闭源性质,将其用作评估器导致了透明度、可控性和成本效益方面的问题。一些研究人员转向使用微调后的开源LLM作为评估器。然而,现有的开源评估LLM通常缺乏用户友好的可视化工具,并且没有针对加速模型推理进行优化,这给资源有限的研究人员和跨领域工作的研究人员带来了不便。本文介绍了EasyJudge,一个旨在评估重要语言模型响应的模型。它轻量、精确、高效且用户友好,具有直观的可视化界面,便于部署和使用。EasyJudge使用详细的数据集和精炼的提示进行模型优化,实现了与人类和专有模型评估的高度一致性。通过量化方法优化的模型使得EasyJudge能够在消费级GPU甚至CPU上高效运行。我们还提供了详细的分析和案例研究,以进一步揭示我们方法的潜力。

关键词

引用

@article{arxiv.2410.09775,
  title  = {EasyJudge: an Easy-to-use Tool for Comprehensive Response Evaluation of LLMs},
  author = {Yijie Li and Yuan Sun},
  journal= {arXiv preprint arXiv:2410.09775},
  year   = {2024}
}