预训练(几乎)就是你所需要的一切:在常识推理中的应用
计算与语言
2020-04-30 v1 机器学习
摘要
微调预训练的 transformer 模型已成为解决常见 NLP 任务的标准方法。现有多数方法依赖在此类网络顶部随机初始化的分类器。我们认为该微调过程次优,因为预训练模型对特定分类器标签无先验,而其可能已学到任务的内在文本表示。本文引入一种新的打分方法,将合理性排序任务转换为全文格式,并利用预训练阶段调优的掩码语言建模头。我们研究常识推理任务,其中模型须在给定前提时对一组假设排序,聚焦于 COPA、Swag、HellaSwag 和 CommonsenseQA 数据集。通过利用我们的打分方法而不微调,我们能够产生可与监督方法媲美的强基线(如 COPA 上 80% 测试准确率)。此外,当直接在我们提出的打分函数上微调时,我们的方法在随机重启间提供更稳定的训练阶段(如 COPA 测试准确率标准差降低 ),且比标准分类器方法需要更少标注数据以达到同等性能。
引用
@article{arxiv.2004.14074,
title = {Pre-training Is (Almost) All You Need: An Application to Commonsense Reasoning},
author = {Alexandre Tamborrino and Nicola Pellicano and Baptiste Pannier and Pascal Voitot and Louise Naudin},
journal= {arXiv preprint arXiv:2004.14074},
year = {2020}
}
备注
Accepted at ACL 2020