LalaEval:用于特定领域大型语言模型的全面人类评估框架
人机交互
2024-08-27 v1 人工智能
计算与语言
摘要
本文介绍 LalaEval,一个用于特定领域大型语言模型(LLM)人类评估的全面框架。LalaEval 提出了一套完整的端到端协议,涵盖五个主要组成部分,包括领域规格、标准制定、基准数据集创建、评估评语表构建以及评估结果的深入分析和解释。本计划旨填补关键研究空白,提供用于进行特定领域标准化人类评估的方法,这种做法尽管广泛应用于人工智能领域,却在文献中缺乏大量覆盖,人类评估常因主观因素而被批评可靠性较差,因此需要针对特定领域甚至单个组织的细微要求制定标准化程序。此外,本文演示了该框架在物流行业中的应用,呈现了特定于物流的评估基准、数据集以及对物流领域 LLMs 进行比较分析,凸显了该框架在阐明性能差异和指导特定领域 LLM 选择和开发方面的能力。通过实际部署,本文强调了该框架在推动特定领域 LLM 评估领域发展方面的有效性,从而对 LLMs 在特定应用中的实际实用性和性能进行讨论作出了重要贡献。
引用
@article{arxiv.2408.13338,
title = {LalaEval: A Holistic Human Evaluation Framework for Domain-Specific Large Language Models},
author = {Chongyan Sun and Ken Lin and Shiwei Wang and Hulong Wu and Chengfei Fu and Zhen Wang},
journal= {arXiv preprint arXiv:2408.13338},
year = {2024}
}