教材即你所需要 II:phi-1.5 技术报告
计算与语言
2023-09-12 v1 人工智能
摘要
我们延续了由 \textbf{TinyStories}(一个可生成连贯英文的 1000 万参数模型)发起的、关于较小 Transformer 语言模型能力的探究,以及后续关于 \textbf{phi-1}(一个 Python 编码性能接近最先进水平的 13 亿参数模型)的工作。后一项工作提出利用现有大语言模型(Large Language Models, LLMs)生成“教科书质量”数据,作为相比传统网络数据增强学习过程的方法。我们遵循“教材即你所需要”的思路,此次聚焦于自然语言中的常识推理,并创建了一个新的 13 亿参数模型 \textbf{phi-1.5},其在自然语言任务上的表现可与大 5 倍的模型相媲美,并在年级数学和基础编程等更复杂推理任务上超越大多数非前沿 LLM。更一般地,\textbf{phi-1.5} 展现出许多大得多的 LLM 的特质,既有好的——如“逐步思考”能力或进行某些初步的上下文学习——也有坏的,包括幻觉以及生成有毒和偏见内容的潜在可能;但令人鼓舞的是,由于不含网络数据,我们在此方面看到了改善。我们开源 \textbf{phi-1.5} 以促进对这些紧迫课题的进一步研究。
引用
@article{arxiv.2309.05463,
title = {Textbooks Are All You Need II: phi-1.5 technical report},
author = {Yuanzhi Li and Sébastien Bubeck and Ronen Eldan and Allie Del Giorno and Suriya Gunasekar and Yin Tat Lee},
journal= {arXiv preprint arXiv:2309.05463},
year = {2023}
}