中文

通过大规模指令合成提升大语言模型的自然语言理解能力

计算与语言 2025-02-07 v1 人工智能

摘要

高质量、大规模的指令对于对齐大语言模型(LLM)至关重要,然而,自然语言理解(NLU)领域存在严重的指令短缺问题。以往构建NLU指令的工作主要集中在信息抽取(IE)上,忽略了机器阅读理解、问答和文本分类等任务。此外,数据多样性的缺乏导致训练后的LLM在其他NLU任务上的泛化能力下降,并且基础模型的通用能力出现明显衰退。为解决这一问题,我们提出了Hum,一个面向NLU任务的大规模、高质量合成指令语料库,旨在增强LLM的NLU能力。具体而言,Hum包含信息抽取(封闭式IE或开放式IE)、机器阅读理解、文本分类以及指令通才任务,从而丰富了任务多样性。此外,我们引入了一种人-LLM协同机制来合成指令,通过融入指南、偏好规则和格式变体来丰富指令多样性。我们在5个NLU任务和28个LLM通用能力评估数据集上进行了广泛实验。实验结果表明,Hum将六种LLM的NLU能力平均提升了3.1%,且在其他通用能力上没有观察到显著下降。

关键词

引用

@article{arxiv.2502.03843,
  title  = {Improving Natural Language Understanding for LLMs via Large-Scale Instruction Synthesis},
  author = {Lin Yuan and Jun Xu and Honghao Gui and Mengshu Sun and Zhiqiang Zhang and Lei Liang and Jun Zhou},
  journal= {arXiv preprint arXiv:2502.03843},
  year   = {2025}
}

备注

Accepted by AAAI 2025