中文

Orca:从GPT-4的复杂解释轨迹中进行渐进学习

计算与语言 2023-06-06 v1 机器学习

摘要

近期研究聚焦于通过模仿学习增强较小模型的能力,利用大型基础模型(LFMs)生成的输出。诸多问题影响这些模型的质量,包括来自浅层LFM输出的有限模仿信号、小规模同质训练数据,以及最显著地缺乏严格评估导致高估小模型能力——因为它们往往学会模仿风格而非LFMs的推理过程。为应对这些挑战,我们开发了Orca(我们正在与法务团队按LLaMA发布政策公开发布模型权重的diff,将于https://aka.ms/orca-lm发布),一个130亿参数的模型,学习模仿LFMs的推理过程。Orca从GPT-4的丰富信号中学习,包括解释轨迹、逐步思维过程及其他复杂指令,并由ChatGPT的教师辅助引导。为促进这种渐进学习,我们利用大规模且多样的模仿数据,通过审慎采样与筛选。Orca在Big-Bench Hard (BBH)等复杂零样本推理基准上以超过100%的优势超越常规最先进指令微调模型如Vicuna-13B,在AGIEval上超出42%。此外,Orca在BBH基准上与ChatGPT持平,并在SAT、LSAT、GRE和GMAT等专业与学术考试中展现竞争力(与优化系统消息有4分差距),两者均在无CoT的零样本设定下;虽落后于GPT-4。我们的研究表明,从逐步解释中学习——无论这些解释由人类还是更先进的AI模型生成——是提升模型能力与技能的有前景方向。

关键词

引用

@article{arxiv.2306.02707,
  title  = {Orca: Progressive Learning from Complex Explanation Traces of GPT-4},
  author = {Subhabrata Mukherjee and Arindam Mitra and Ganesh Jawahar and Sahaj Agarwal and Hamid Palangi and Ahmed Awadallah},
  journal= {arXiv preprint arXiv:2306.02707},
  year   = {2023}
}