小模型,大任务:关于小型语言模型进行功能调用的探索性实证研究
人工智能
2025-04-29 v1 软件工程
摘要
功能调用是一种具有广泛应用的复杂任务,涵盖信息检索、软件工程和自动化等领域。例如,要查询从纽约到伦敦、1月15日最短航班,需要识别正确的参数以生成准确的功能调用。大型语言模型(LLM)可以自动化此过程,但在资源受限的环境中计算昂贵且不可行。相比之下,小型语言模型(SLM)能高效运行,具备更快的响应速度和更低的计算需求,因而是功能调用边缘设备上的潜在候选方案。本 exploratory 实证研究评估了 SLM 在零样本、few-shot 和微调方法下(带或不带提示注入)生成功能调用的有效性,同时提供微调后的模型以便于未来应用。我们还分析了模型在各种指标上的响应,涵盖功能调用生成的诸多方面。此外,我们在边缘设备上进行实验,评估其延迟和内存使用,为实际可行性提供了有用的见解。我们的发现表明,尽管 SLM 从零样本到 few-shot 上有所改善,微调后表现最佳,但在遵守给定输出格式方面仍存在显著挑战。提示注入实验进一步表明,模型总体上具有鲁健性,仅出现轻微的性能下降。虽然 SLM 在功能调用生成任务中展现出潜力,但我们的研究也指出了实现实时运行仍需进一步完善的领域。
关键词
引用
@article{arxiv.2504.19277,
title = {Small Models, Big Tasks: An Exploratory Empirical Study on Small Language Models for Function Calling},
author = {Ishan Kavathekar and Raghav Donakanti and Ponnurangam Kumaraguru and Karthik Vaidhyanathan},
journal= {arXiv preprint arXiv:2504.19277},
year = {2025}
}
备注
Accepted at EASE 2025 AI Models and Data Evaluation track