中文

基于 LLM 的聊天机器人基准测试:方法与指标

计算与语言 2023-08-10 v1 人工智能

摘要

自主对话智能体,即聊天机器人,正成为企业为客户和合作伙伴提供支持的一种日益常见的机制。为了对聊天机器人(尤其是由大语言模型(LLM)等生成式 AI 工具驱动的聊天机器人)进行评级,我们需要能够准确评估其性能。这正是聊天机器人基准测试变得重要的地方。在本文中,我们提出使用一种称为 E2E(端到端)基准的新颖基准,并展示如何使用 E2E 基准来评估聊天机器人(尤其是 LLM 驱动的聊天机器人)所提供答案的准确性和有用性。我们基于我们的 E2E 基准以及当前最先进中常用的其他可用指标,在不同复杂程度下评估了一个示例聊天机器人,并观察到所提出的基准相比其他基准显示出更好的结果。此外,尽管某些指标被证明是不可预测的,但与 E2E 基准相关的、使用余弦相似度的指标在评估聊天机器人方面表现良好。我们最佳模型的表现表明,在 E2E 基准中使用余弦相似度得分作为指标具有若干好处。

关键词

引用

@article{arxiv.2308.04624,
  title  = {Benchmarking LLM powered Chatbots: Methods and Metrics},
  author = {Debarag Banerjee and Pooja Singh and Arjun Avadhanam and Saksham Srivastava},
  journal= {arXiv preprint arXiv:2308.04624},
  year   = {2023}
}

备注

8 pages, 14 figures