中文

超越静态评估:一种评估 AI 助手 API 调用能力的动态方法

计算与语言 2024-03-28 v2

摘要

随着大语言模型(LLM)的兴起,AI 助手利用工具(尤其是通过 API 调用)的能力取得了显著进展。这一进步需要更准确的评估方法。许多现有研究采用静态评估,即基于预定义的对话历史来评估 AI 助手的 API 调用。然而,这种评估方法可能具有误导性,因为在真实场景中,AI 助手可能无法根据先前的人类交互生成 API 调用。我们提出自动化动态评估(Automated Dynamic Evaluation, AutoDE),以替代资源密集的直接人机交互方法,在无需人类参与的情况下评估助手的 API 调用能力。在我们的框架中,我们致力于使用基于 LLM 的用户代理(配备用户脚本以确保人类对齐),在人机交互中紧密模拟真实的人类对话模式。实验结果突显,AutoDE 揭示了静态评估忽略的错误,与人类评估更为一致。使用我们精心设计的基准对四个 AI 助手进行测试,与传统静态评估相比,我们的方法进一步反映了人类评估结果。

关键词

引用

@article{arxiv.2403.11128,
  title  = {Beyond Static Evaluation: A Dynamic Approach to Assessing AI Assistants' API Invocation Capabilities},
  author = {Honglin Mu and Yang Xu and Yunlong Feng and Xiaofeng Han and Yitong Li and Yutai Hou and Wanxiang Che},
  journal= {arXiv preprint arXiv:2403.11128},
  year   = {2024}
}

备注

Accepted at LREC-COLING 2024