用梯度提升决策树增强 Transformer 以进行 NLI 微调
计算与语言
2022-09-13 v2
摘要
迁移学习已成为许多自然语言处理任务的主导范式。除了在大型数据集上预训练的模型外,它们还可以在与目标任务相似的中间(有监督)任务上进一步训练。对于小型自然语言推理(NLI)数据集,通常先进行语言建模,再在大型(带标签的)NLI 数据集上预训练,然后利用各 NLI 子任务进行微调。在本工作中,我们探索将梯度提升决策树(GBDTs)作为常用的多层感知机(MLP)分类头的替代方案。GBDTs 具有一些理想特性,例如对稠密数值特征表现良好,并且在样本数相对于特征数之比较低的场景下依然有效。随后我们引入 FreeGBDT,一种在微调过程中对计算所得特征拟合 GBDT 头的方法,以在不增加神经网络额外计算的情况下提升性能。我们使用强基线模型(经 MNLI 预训练的 RoBERTa-large)在多个 NLI 数据集上证明了方法的有效性。FreeGBDT 相比 MLP 分类头展现出一致的改进。
引用
@article{arxiv.2105.03791,
title = {Enhancing Transformers with Gradient Boosted Decision Trees for NLI Fine-Tuning},
author = {Benjamin Minixhofer and Milan Gritta and Ignacio Iacobacci},
journal= {arXiv preprint arXiv:2105.03791},
year = {2022}
}
备注
Findings of ACL 2021