Baby的CoThought:利用大语言模型增强紧凑模型的推理能力
计算与语言
2023-10-24 v2
摘要
大语言模型(LLMs)在多种自然语言理解(NLU)任务上展现出卓越性能,主要得益于其上下文学习能力。该能力可应用于构建类婴儿的模型,即小尺度模型,以提升训练效率。本文提出一种“CoThought”流水线,通过利用LLM的思维链提示高效训练较小的“婴儿”语言模型(BabyLM)。我们的流水线使用 GPT-3.5-turbo 对规模小于 100M 的数据集进行重构,将其转化为面向任务、人类可读的文本,类似于面向语言学习者的教材文本。随后 BabyLM 以 RoBERTa 方式在该重构数据集上预训练。在 4 个基准的评估中,我们的 BabyLM 在 10 项语言、NLU 和问答任务上以超过 3 分的优势优于原始 RoBERTa,展现出更优的上下文信息提取能力。这些结果表明,在经LLM重构的小规模数据上预训练的紧凑LM能更好地理解任务并取得改进的性能。
引用
@article{arxiv.2308.01684,
title = {Baby's CoThought: Leveraging Large Language Models for Enhanced Reasoning in Compact Models},
author = {Zheyu Zhang and Han Yang and Bolei Ma and David Rügamer and Ercong Nie},
journal= {arXiv preprint arXiv:2308.01684},
year = {2023}
}
备注
CoNLL 2023 BabyLM Challenge