利用自监督注意力改进 BERT
计算与语言
2021-10-25 v4 机器学习
摘要
应用诸如 BERT 等大型预训练 NLP 模型的一个最流行范式是在较小的数据集上对其进行微调。然而,一个挑战依然存在:微调后的模型经常在较小数据集上过拟合。这一现象的一个症状是,句子中对于人类易于理解的无关或误导性词语会大幅降低这些微调 BERT 模型的性能。在本文中,我们提出一种称为自监督注意力(Self-Supervised Attention, SSA)的新技术,以帮助应对这一泛化挑战。具体而言,SSA 通过探测上一轮迭代的微调模型,迭代地自动生成弱 token 级注意力标签。我们研究了将 SSA 集成到 BERT 中的两种不同方式,并提出了一种混合方法来结合它们的优势。通过大量公开数据集,我们从经验上表明使用我们的 SSA 增强 BERT 模型取得了显著的性能提升。
引用
@article{arxiv.2004.03808,
title = {Improving BERT with Self-Supervised Attention},
author = {Yiren Chen and Xiaoyu Kou and Jiangang Bai and Yunhai Tong},
journal= {arXiv preprint arXiv:2004.03808},
year = {2021}
}