基于 LLM 的聊天机器人基准测试:方法与指标
计算与语言
2023-08-10 v1 人工智能
摘要
自主对话智能体,即聊天机器人,正成为企业为客户和合作伙伴提供支持的一种日益常见的机制。为了对聊天机器人(尤其是由大语言模型(LLM)等生成式 AI 工具驱动的聊天机器人)进行评级,我们需要能够准确评估其性能。这正是聊天机器人基准测试变得重要的地方。在本文中,我们提出使用一种称为 E2E(端到端)基准的新颖基准,并展示如何使用 E2E 基准来评估聊天机器人(尤其是 LLM 驱动的聊天机器人)所提供答案的准确性和有用性。我们基于我们的 E2E 基准以及当前最先进中常用的其他可用指标,在不同复杂程度下评估了一个示例聊天机器人,并观察到所提出的基准相比其他基准显示出更好的结果。此外,尽管某些指标被证明是不可预测的,但与 E2E 基准相关的、使用余弦相似度的指标在评估聊天机器人方面表现良好。我们最佳模型的表现表明,在 E2E 基准中使用余弦相似度得分作为指标具有若干好处。
引用
@article{arxiv.2308.04624,
title = {Benchmarking LLM powered Chatbots: Methods and Metrics},
author = {Debarag Banerjee and Pooja Singh and Arjun Avadhanam and Saksham Srivastava},
journal= {arXiv preprint arXiv:2308.04624},
year = {2023}
}
备注
8 pages, 14 figures