中文

Fusion-Eval:将辅助评估器与LLM相集成

计算与语言 2024-06-10 v3 人工智能

摘要

评估自然语言系统带来了重大挑战,特别是在自然语言理解和高层推理领域。在本文中,我们介绍了“Fusion-Eval”,一种利用大语言模型(LLMs)来整合来自各种辅助评估器见解的创新方法。该LLM被给定待评估的样例以及来自辅助评估器的分数。这些评估器各自专门评估响应的不同方面。Fusion-Eval在SummEval上取得了与人类0.962的系统级Kendall-Tau相关性,在TopicalChat上取得了0.744的轮次级Spearman相关性,显著高于基线方法。这些结果凸显了Fusion-Eval在自然语言系统评估领域的重大潜力。

关键词

引用

@article{arxiv.2311.09204,
  title  = {Fusion-Eval: Integrating Assistant Evaluators with LLMs},
  author = {Lei Shu and Nevan Wichers and Liangchen Luo and Yun Zhu and Yinxiao Liu and Jindong Chen and Lei Meng},
  journal= {arXiv preprint arXiv:2311.09204},
  year   = {2024}
}