NewsBERT:面向智能新闻应用蒸馏预训练语言模型
计算与语言
2021-09-03 v2
摘要
诸如 BERT 之类的预训练语言模型(PLMs)已在自然语言处理(NLP)中取得重大进展。新闻文章通常包含丰富的文本信息,PLMs 有潜力增强各类智能新闻应用(如新闻推荐与检索)中的新闻文本建模。然而,现有多数 PLMs 规模庞大,拥有数亿参数。许多在线新闻应用需以低延迟容忍服务数百万用户,这为在此类场景中引入 PLMs 带来巨大挑战。知识蒸馏技术可将大型 PLM 压缩为小得多的模型,同时保持良好性能。但现有语言模型是在如维基百科等通用语料上预训练与蒸馏的,与新闻领域存在差距,对新闻智能而言可能并非最优。本文提出 NewsBERT,可针对高效且有效的新闻智能蒸馏 PLMs。在我们的方法中,设计了一种师生联合学习与蒸馏框架来协同学习教师与学生模型,使学生模型能从教师模型的学习经验中获益。此外,我们提出动量蒸馏方法,将教师模型的梯度融入学生模型更新以更好地迁移教师所学有用知识。在三个任务的两个真实数据集上的大量实验表明,NewsBERT 能以小得多的模型有效提升各类智能新闻应用中的模型性能。
引用
@article{arxiv.2102.04887,
title = {NewsBERT: Distilling Pre-trained Language Model for Intelligent News Application},
author = {Chuhan Wu and Fangzhao Wu and Yang Yu and Tao Qi and Yongfeng Huang and Qi Liu},
journal= {arXiv preprint arXiv:2102.04887},
year = {2021}
}