中文

ZEN 2.0:面向 N-gram 增强文本编码器的继续训练与自适应

计算与语言 2021-05-05 v1 人工智能

摘要

预训练文本编码器在自然语言处理(NLP)中持续受到关注,并展现出在不同任务上取得优异结果的能力。近期研究表明,外部自监督信号(或通过无监督学习提取的知识,如 n-gram)有益于为理解中文等语言提供有用的语义证据,从而相应提升各类下游任务的性能。为进一步增强编码器,本文提出以海量数据及先进训练技术预训练 n-gram 增强编码器。此外,我们尝试将编码器扩展至不同语言及不同领域,证实相同架构适用于这些多变场景,并在跨语言与领域的长串 NLP 任务列表中观察到新的当前最优(state-of-the-art)性能。

关键词

引用

@article{arxiv.2105.01279,
  title  = {ZEN 2.0: Continue Training and Adaption for N-gram Enhanced Text Encoders},
  author = {Yan Song and Tong Zhang and Yonggang Wang and Kai-Fu Lee},
  journal= {arXiv preprint arXiv:2105.01279},
  year   = {2021}
}

备注

13 pages, 7 figures