TeacherLM:授人以渔而非授人以鱼,语言建模亦然
计算与语言
2024-07-17 v3 人工智能
摘要
大语言模型(LLMs)在各种 NLP 任务中展现出令人印象深刻的推理与数据增强能力。然而,小模型又如何呢?在本工作中,我们提出 TeacherLM-7.1B,它能够为大多数 NLP 样本标注相关基础知识、思维链与常见错误,这使得标注不止于答案,从而让其他模型学习“为何”而非仅仅“何者”。TeacherLM-7.1B 模型在 MMLU 上取得了 52.3 的零样本分数,超越了多数参数量超过 100B 的模型。更引人注目的是其数据增强能力。基于 TeacherLM-7.1B,我们增强了 58 个 NLP 数据集,并在多任务设定下教导了来自 OPT 与 BLOOM 系列、具有不同参数的多种学生模型。实验结果表明,TeacherLM 提供的数据增强带来了显著收益。我们将开源 TeacherLM 系列模型与增强数据集。
引用
@article{arxiv.2310.19019,
title = {TeacherLM: Teaching to Fish Rather Than Giving the Fish, Language Modeling Likewise},
author = {Nan He and Hanyu Lai and Chenyang Zhao and Zirui Cheng and Junting Pan and Ruoyu Qin and Ruofan Lu and Rui Lu and Yunchen Zhang and Gangming Zhao and Zhaohui Hou and Zhiyuan Huang and Shaoqing Lu and Ding Liang and Mingjie Zhan},
journal= {arXiv preprint arXiv:2310.19019},
year = {2024}
}
备注
5 figures, 15 pages