ZEN 2.0:面向 N-gram 增强文本编码器的继续训练与自适应
计算与语言
2021-05-05 v1 人工智能
摘要
预训练文本编码器在自然语言处理(NLP)中持续受到关注,并展现出在不同任务上取得优异结果的能力。近期研究表明,外部自监督信号(或通过无监督学习提取的知识,如 n-gram)有益于为理解中文等语言提供有用的语义证据,从而相应提升各类下游任务的性能。为进一步增强编码器,本文提出以海量数据及先进训练技术预训练 n-gram 增强编码器。此外,我们尝试将编码器扩展至不同语言及不同领域,证实相同架构适用于这些多变场景,并在跨语言与领域的长串 NLP 任务列表中观察到新的当前最优(state-of-the-art)性能。
引用
@article{arxiv.2105.01279,
title = {ZEN 2.0: Continue Training and Adaption for N-gram Enhanced Text Encoders},
author = {Yan Song and Tong Zhang and Yonggang Wang and Kai-Fu Lee},
journal= {arXiv preprint arXiv:2105.01279},
year = {2021}
}
备注
13 pages, 7 figures