中文

以歧义消除为中心的微调使企业工具调用LLM更真实可靠且风险更低

数值分析 2025-07-08 v1 数值分析

摘要

大型语言模型(LLMs)越来越被任务调用企业API,但它们在面对近似重复工具争夺同一用户意图或必需参数未明确指定时常常难以完成任务。我们引入DiaFORGE(Dialogue Framework for Organic Response Generation & Evaluation),一个以歧义消除为中心的三阶段流程:(i)合成具有代表性且多轮的对话,其中助手必须区分高度相似的工具;(ii)使用包含推理痕迹的监督式微调开源模型,参数规模从3B到70B不等;(iii)通过动态套件评估实际就绪性,该套件在每个模型部署后重新部署到活跃的代理循环中,并报告端到端目标完成情况以及常规静态指标。我们在动态基准DiaBENCH上,采用DiaFORGE训练的模型在优化提示下的工具调用成功率比GPT-4o提升27个百分点,比Claude-3.5-Sonnet提升49个百分点。为促进进一步的研究,我们发布了一个包含5000个生产级企业API规范及其严格验证的、以歧义消除为导向的对话语料库,为构建可靠且企业就绪的工具调用智能体提供了实用的蓝图。

关键词

引用

@article{arxiv.2507.03335,
  title  = {Structured Backward Errors of Sparse Generalized Saddle Point Problems with Hermitian Block Matrices},
  author = {Sk. Safique Ahmad and Pinki Khatun},
  journal= {arXiv preprint arXiv:2507.03335},
  year   = {2025}
}