用于评估工具增强型大语言模型作为对话 AI 代理的自动化测试生成
计算与语言
2024-10-11 v2 人工智能
机器学习
摘要
工具增强型大语言模型是构建能够进行真实对话、遵循程序并调用合适函数的 AI 代理的有前景的方法。然而,对它们进行评估具有挑战性,因为可能的对话种类繁多,现有数据集仅关注单次交互和函数调用。我们提出了评估大语言模型作为对话 AI 代理的测试生成管道。该框架利用大语言模型基于用户定义的程序生成多样化测试。为此,我们使用中间图谱限制大语言模型测试生成器倾向于生成不基于输入程序的幻觉内容,并确保对可能的对话具有高覆盖率。此外,我们提出 ALMITA,这是一个手动精选的用于评估 AI 代理在客户支持场景中的数据集,并用于评估现有大语言模型。我们的结果表明,尽管工具增强型大语言模型在单次交互方面表现良好,但在处理完整对话时常常力不从众。虽然我们的工作侧重于客户支持,但该方法通用且能够适用于不同领域的 AI 代理。
关键词
引用
@article{arxiv.2409.15934,
title = {Automated test generation to evaluate tool-augmented LLMs as conversational AI agents},
author = {Samuel Arcadinho and David Aparicio and Mariana Almeida},
journal= {arXiv preprint arXiv:2409.15934},
year = {2024}
}
备注
14 pages, 5 figures, Submitted to GenBench@EMNLP2024