中文

Floworks 与 OpenAI 和 Anthropic 的基准测试:一种增强 LLM 函数调用的新框架

人工智能 2024-10-24 v1

摘要

大型语言模型(LLM)在各个领域展现出了卓越的能力,但其经济影响一直受到工具使用和函数调用方面挑战的限制。本文介绍了 ThorV2,一种新颖的架构,它显著增强了 LLM 的函数调用能力。我们开发了一个专注于 HubSpot CRM 操作的综合基准测试,以评估 ThorV2 与 OpenAI 和 Anthropic 的领先模型。我们的结果表明,在单 API 和多 API 调用任务中,ThorV2 在准确性、可靠性、延迟和成本效率方面均优于现有模型。我们还表明,与传统模型相比,ThorV2 更可靠,并且能更好地扩展到多步骤任务。我们的工作提供了诱人的可能性,即与当今性能最佳的模型相比,使用明显更小的 LLM 也能实现更准确的函数调用。这些进展对于开发更强大的 AI 助手以及 LLM 在现实场景中的更广泛应用具有重要意义。

关键词

引用

@article{arxiv.2410.17950,
  title  = {Benchmarking Floworks against OpenAI & Anthropic: A Novel Framework for Enhanced LLM Function Calling},
  author = {Nirav Bhan and Shival Gupta and Sai Manaswini and Ritik Baba and Narun Yadav and Hillori Desai and Yash Choudhary and Aman Pawar and Sarthak Shrivastava and Sudipta Biswas},
  journal= {arXiv preprint arXiv:2410.17950},
  year   = {2024}
}

备注

15 pages for main paper, 21 pages in total including references and appendix, 10 figures