提升预训练语言模型在真实应用中的可复用性
计算与语言
2023-08-09 v3
摘要
最先进的预训练语言模型(PLM)的可复用性常受其泛化问题限制,即当在异于训练数据集的样本(称为分布外(OOD)/未见样本)上评估时性能急剧下降。该局限源于 PLM 对虚假相关性的依赖,其对频繁样本类型有效,但对一般样本无效。为解决此问题,我们提出一种称为掩码微调(Mask-tuning)的训练方法,将掩码语言建模(MLM)训练目标整合进微调过程以增强 PLM 的泛化能力。综合实验表明,Mask-tuning 超越当前最先进技术,在 OOD 数据集上增强 PLM 泛化的同时提升其在分布内数据集上的性能。结果表明 Mask-tuning 提升了 PLM 在未见数据上的可复用性,使其对真实应用更实用有效。
引用
@article{arxiv.2307.10457,
title = {Improving the Reusability of Pre-trained Language Models in Real-world Applications},
author = {Somayeh Ghanbarzadeh and Hamid Palangi and Yan Huang and Radames Cruz Moreno and Hamed Khanpour},
journal= {arXiv preprint arXiv:2307.10457},
year = {2023}
}
备注
Accepted as a long paper and awarded as the BEST Resaerch Paper in IEEE IRI'23 (IEEE 24th International conference on Information Reuse and Integrationfor Data Science)