中文

简单训练数据在困难任务上的不合理有效性

计算与语言 2024-06-06 v2 人工智能 机器学习

摘要

当困难训练数据根据定义难以正确标注时,我们如何训练模型使其在困难测试数据上表现良好?这个问题被称为可扩展监督问题,并随着语言模型的持续改进而受到越来越多的关注。在本文中,我们提出了一个令人惊讶的结论:当前的预训练语言模型通常能相对良好地从简单数据泛化到困难数据,甚至表现得与在困难数据上微调的预言机模型一样好。我们使用简单的微调方法(如上下文学习、线性分类器头和QLoRA),针对七种不同的数据点难度度量(包括六种经验多样的人类难度度量(如年级水平)和一种基于模型的度量(基于损失)),展示了这种从易到难的泛化能力。此外,我们表明,即使人们最关心模型在困难数据上的表现,收集简单数据而非困难数据进行微调也可能更好,因为困难数据通常噪声更大且收集成本更高。我们的实验使用了规模高达70b的开放模型和四个公开可用的问答数据集,其中的问题难度范围从三年级科学问题到大学水平的STEM问题和常识问答。我们得出结论,对于所研究的任务,语言模型中的从易到难泛化能力出奇地强。我们的代码可在以下链接获取:https://github.com/allenai/easy-to-hard-generalization

关键词

引用

@article{arxiv.2401.06751,
  title  = {The Unreasonable Effectiveness of Easy Training Data for Hard Tasks},
  author = {Peter Hase and Mohit Bansal and Peter Clark and Sarah Wiegreffe},
  journal= {arXiv preprint arXiv:2401.06751},
  year   = {2024}
}

备注

ACL 2024. 23 pages, 20 figures