中文

从委派到学习:LLM 级联中的在线情境知识蒸馏

人工智能 2026-02-04 v2 计算与语言

摘要

标准 LLM 级联通过将难题查询委派给强模型来提高效率,但这些系统通常是静态的:面对重复或语义相似的查询时,仍会冗余地调用昂贵模型,无法在推理期间适应。为此,我们提出 Inter-Cascade,一种在线交互式框架,将强模型从临时助手转化为长期教师。在我们的方法中,当强模型解决委派查询时,它会生成通用、可重用的问题解决策略。这些策略存储在动态存储库中,通过相似度匹配检索,用于增强弱模型的上下文以处理未来查询。这使弱模型能够在不进行昂贵参数微调的情况下“即学即用”。我们理论上证明,这一机制可改喃弱模型的置信度校准。实验方面,Inter-Cascade 在多个基准测试中超越标准级联,使弱模型和整体系统准确率提升最高可达 33.06% 和 6.35%,同时降低强模型调用次数最高可达 48.05%,费用节省最高可达 49.63%。Inter-Cascade 展示了 LLM 之间有效的情境知识传递,提供了适用于开源和 API-based LLM 的通用、可扩展框架。

关键词

引用

@article{arxiv.2509.22984,
  title  = {From Deferral to Learning: Online In-Context Knowledge Distillation for LLM Cascades},
  author = {Yu Wu and Shuo Wu and Ye Tao and Yansong Li and Anand D. Sarwate},
  journal= {arXiv preprint arXiv:2509.22984},
  year   = {2026}
}

备注

32 pages, 6 figures, 23 tables, under review