中文

LLM-Eval:基于大语言模型的开域对话统一多维自动评估方法

计算与语言 2023-05-24 v1 人工智能

摘要

我们提出 LLM-Eval,一种基于大语言模型(LLMs)的开域对话统一多维自动评估方法。现有评估方法常依赖人工标注、真实回复或多个 LLM 提示,这可能昂贵且耗时。为解决这些问题,我们设计了一种基于单一提示的评估方法,利用统一评估框架在单次模型调用中覆盖对话质量的多个维度。我们在多个基准数据集上广泛评估了 LLM-Eval 的性能,证明了其相较于最先进评估方法的有效性、高效性和适应性。我们的分析还强调了选择合适的 LLM 和解码策略对准确评估结果的重要性。LLM-Eval 为评估开域对话系统提供了一种通用且鲁棒的解决方案,简化了评估流程并在不同场景中提供一致的性能。

关键词

引用

@article{arxiv.2305.13711,
  title  = {LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models},
  author = {Yen-Ting Lin and Yun-Nung Chen},
  journal= {arXiv preprint arXiv:2305.13711},
  year   = {2023}
}

备注

Accepted at 5th NLP4ConvAI