基于相似性引导的教师辅助超小型函数调用模型精炼框架 STAR
人工智能
2026-02-25 v2
摘要
大型语言模型(LLM)在函数调用中的快速扩散是创建高级 AI 代理的关键,但其大规模尺度阻碍了广泛采用,使得需要将其能力迁移到较小的模型。然而,现有方法常常受到过拟合、训练不稳定、对多解任务无效的二进制奖励以及技术融合困难的困扰。我们引入 STAR:相似性引导的教师辅助精炼,这是一个有效将 LLM 能力迁移到超小型模型的全新综合框架。STAR 由两个核心技术创新构成:(1)受约束知识蒸馏(CKD),这是一种训练目标,通过增强前 K 级 KL 发散来抑制自信错误预测的能力,确保训练稳定性同时保留下游 RL 的探索能力。STAR 在一个连贯的训练课程中将这些策略全面集成,使超小型模型能够在复杂的函数调用任务上实现卓越的性能;(2)相似性引导的强化学习(Sim-RL),这是一种强化学习机制,引入细粒度的相似性奖励。这为更好的策略优化提供了稳健、连续且丰富的信号,通过评估生成输出与真实答案之间的相似性。大量在具有挑战性和著名基准上的实验表明,我们方法的有效性。我们的 STAR 模型在各自的尺寸类别中建立了 SOTA,显著优于基线方法。惊人的是,我们的 0.6B STAR 模型在所有小于 1B 的开放模型中取得最佳性能,甚至超过了几个更大规模的著名开放模型。STAR 展示了一个将 LLM 能力蒸馏到超小型模型的训练框架,为强大、可接近且高效的 AI 代理铺平了道路。
引用
@article{arxiv.2602.03022,
title = {STAR: Similarity-guided Teacher-Assisted Refinement for Super-Tiny Function Calling Models},
author = {Jiliang Ni and Jiachen Pu and Zhongyi Yang and Jingfeng Luo and Conggang Hu},
journal= {arXiv preprint arXiv:2602.03022},
year = {2026}
}
备注
The paper has been accepted to ICLR 2026