通过多层次文本判别构建中文生物医学语言模型
计算与语言
2022-03-03 v2 人工智能
摘要
预训练语言模型 (PLM),如 BERT 和 GPT,不仅在通用领域,也在生物医学领域彻底改变了自然语言处理 (NLP) 领域。先前构建生物医学 PLM 的大多数努力仅简单地诉诸于领域自适应,并主要集中在英语上。在这项工作中,我们引入了 eHealth,一个从头开始构建的中文生物医学 PLM,并采用了一个新的预训练框架。这个新框架通过词元级和序列级判别,将 eHealth 预训练为一个判别器。前者旨在检测被生成器破坏的输入词元,并从合理的候选中恢复其原始身份,而后者则进一步将同一原始序列的破坏与其它序列的破坏区分开来。如此一来,eHealth 可以在词元和序列两个层面上学习语言语义。在 11 个不同形式的中文生物医学语言理解任务上的大量实验验证了我们方法的有效性和优越性。我们在 \url{https://github.com/PaddlePaddle/Research/tree/master/KG/eHealth} 发布了预训练模型,稍后也将发布代码。
引用
@article{arxiv.2110.07244,
title = {Building Chinese Biomedical Language Models via Multi-Level Text Discrimination},
author = {Quan Wang and Songtai Dai and Benfeng Xu and Yajuan Lyu and Yong Zhu and Hua Wu and Haifeng Wang},
journal= {arXiv preprint arXiv:2110.07244},
year = {2022}
}