中文

Baby的CoThought:利用大语言模型增强紧凑模型的推理能力

计算与语言 2023-10-24 v2

摘要

大语言模型(LLMs)在多种自然语言理解(NLU)任务上展现出卓越性能,主要得益于其上下文学习能力。该能力可应用于构建类婴儿的模型,即小尺度模型,以提升训练效率。本文提出一种“CoThought”流水线,通过利用LLM的思维链提示高效训练较小的“婴儿”语言模型(BabyLM)。我们的流水线使用 GPT-3.5-turbo 对规模小于 100M 的数据集进行重构,将其转化为面向任务、人类可读的文本,类似于面向语言学习者的教材文本。随后 BabyLM 以 RoBERTa 方式在该重构数据集上预训练。在 4 个基准的评估中,我们的 BabyLM 在 10 项语言、NLU 和问答任务上以超过 3 分的优势优于原始 RoBERTa,展现出更优的上下文信息提取能力。这些结果表明,在经LLM重构的小规模数据上预训练的紧凑LM能更好地理解任务并取得改进的性能。

关键词

引用

@article{arxiv.2308.01684,
  title  = {Baby's CoThought: Leveraging Large Language Models for Enhanced Reasoning in Compact Models},
  author = {Zheyu Zhang and Han Yang and Bolei Ma and David Rügamer and Ercong Nie},
  journal= {arXiv preprint arXiv:2308.01684},
  year   = {2023}
}

备注

CoNLL 2023 BabyLM Challenge