重新思考中间任务微调为何有效
计算与语言
2021-09-02 v2
摘要
基于中间标注数据任务的补充训练(STILTs)是一种广泛应用的技术,其先在中间任务上对预训练语言模型进行微调,再在目标任务上进行微调。尽管 STILTs 能够进一步提升预训练语言模型的性能,但其为何以及在何时生效仍不清楚。先前的研究表明,那些涉及复杂推理(如常识推理)的中间任务对 RoBERTa 尤为有效。在本文中,我们发现在中间任务上获得的提升可能与其是否包含推理或其他复杂技能无关——一个由 GPT2 合成的简单真假判别任务即可惠及多样化的目标任务。我们进行了大量实验以研究不同因素对 STILTs 的影响。这些发现提示重新审视中间微调在 STILTs 流程中的作用。
引用
@article{arxiv.2108.11696,
title = {Rethinking Why Intermediate-Task Fine-Tuning Works},
author = {Ting-Yun Chang and Chi-Jen Lu},
journal= {arXiv preprint arXiv:2108.11696},
year = {2021}
}
备注
Findings of EMNLP 2021