中文

评估 LLM 应用程序的挑战:自动化、人类与 LLM 方法的分析

计算与语言 2024-06-14 v2 人工智能

摘要

聊天机器人自诞生以来便是自然语言生成的一个有趣的应用领域。随着基于 Transformer 的生成式 AI 方法的突破,构建聊天机器人变得相对容易。针对医学和心理学等特定领域的聊天机器人迅速得到实施。然而,这不应分散我们对评估聊天机器人响应的注意力。尤其是因为自然语言生成社区并未完全达成关于如何有效评估此类应用程序的共识。本文进一步探讨了这一问题,以及日益流行的基于 LLM 的评估方法如何与人类评估相关联。此外,我们引入了一个综合性的因子化评估机制,可用于人类评估和 LLM 评估中。我们呈现了使用此方案进行的实验评估结果,该方案用于我们实现的一个聊天机器人,该机器人消费了教育报告。随后我们比较了自动化评估、传统人类评估、因子化人类评估和因子化 LLM 评估。结果表明,因子化评估能够更好地揭示在 LLM 应用程序中哪些方面需要改进,从而进一步强化了在主要功能不直接检索的关键领域使用人类评估的论点。

关键词

引用

@article{arxiv.2406.03339,
  title  = {The Challenges of Evaluating LLM Applications: An Analysis of Automated, Human, and LLM-Based Approaches},
  author = {Bhashithe Abeysinghe and Ruhan Circi},
  journal= {arXiv preprint arXiv:2406.03339},
  year   = {2024}
}

备注

Accepted in The First Workshop on Large Language Models for Evaluation in Information Retrieval