通过假设到理论提示从强模型到弱模型的概念蒸馏
人工智能
2025-02-25 v2 计算与语言
摘要
手工制作高质量提示以优化语言模型的性能是一个复杂且耗时的过程。此外,当迁移到较新的、较小的或较弱的模型(可能是由于延迟或成本收益)时,需要更新提示以重新优化任务性能。我们提出概念蒸馏(CD),这是一种自动提示优化技术,用于增强弱模型在复杂任务上的性能。CD 包括:(1)收集弱模型使用基础提示(初始化)所犯下的错误,(2)使用强模型生成这些错误的原因并为弱模型创建规则/概念(归纳),以及(3)基于验证集性能筛选这些规则并将其整合到基础提示中(演绎/验证)。我们在 NL2Code 和数学推理任务上评估了 CD,观察到小型和较弱语言模型的性能显著提升。值得注意的是,Mistral-7B 在 Multi-Arith 上的准确率提升了 20%,Phi-3-mini-3.8B 在 HumanEval 上的准确率提升了 34%。与其他自动方法相比,CD 提供了一种有效且高性价比的策略,用于提高弱模型在复杂任务上的性能,并使在不同语言模型之间实现无缝工作负载迁移成为可能,而不会牺牲性能。
引用
@article{arxiv.2408.09365,
title = {Concept Distillation from Strong to Weak Models via Hypotheses-to-Theories Prompting},
author = {Emmanuel Aboah Boateng and Cassiano O. Becker and Nabiha Asghar and Kabir Walia and Ashwin Srinivasan and Ehi Nosakhare and Soundar Srinivasan and Victor Dibia},
journal= {arXiv preprint arXiv:2408.09365},
year = {2025}
}
备注
Accepted to NAACL 2025; 17 pages, 8 figures