Orca 2:教导小型语言模型如何推理
人工智能
2023-11-23 v2
摘要
Orca 1 从丰富的信号(如解释轨迹)中学习,使其在 BigBench Hard 和 AGIEval 等基准上超越传统的指令微调模型。在 Orca 2 中,我们继续探索改进的训练信号如何增强较小 LM 的推理能力。关于小型 LM 训练的研究常依赖模仿学习来复制更强模型的输出。我们认为,过度强调模仿可能会限制较小模型的潜力。我们力求教导小型 LM 针对不同任务采用不同的解决策略,可能与较大模型所用的策略不同。例如,较大模型可能对复杂任务直接给出答案,而较小模型可能不具备同等能力。在 Orca 2 中,我们教导模型多种推理技术(逐步推理、先回忆再生成、回忆-推理-生成、直接回答等)。更关键的是,我们旨在帮助模型学会为每个任务确定最有效的解决策略。我们使用涵盖约 100 个任务和超过 36,000 条唯一提示的 15 个多样化基准对 Orca 2 进行了全面评估。在测试零样本设置下高级推理能力的复杂任务上,Orca 2 显著超越同等规模的模型,并达到与 5-10 倍更大模型相似或更好的性能水平。我们在 aka.ms/orca-lm 公开 Orca 2 权重,以支持关于小型 LM 开发、评估和对齐的研究。
引用
@article{arxiv.2311.11045,
title = {Orca 2: Teaching Small Language Models How to Reason},
author = {Arindam Mitra and Luciano Del Corro and Shweti Mahajan and Andres Codas and Clarisse Simoes and Sahaj Agarwal and Xuxi Chen and Anastasia Razdaibiedina and Erik Jones and Kriti Aggarwal and Hamid Palangi and Guoqing Zheng and Corby Rosset and Hamed Khanpour and Ahmed Awadallah},
journal= {arXiv preprint arXiv:2311.11045},
year = {2023}
}
备注
Added url to model weights fixed typo in Author name