中文

面向中文生物医学文本挖掘的概念化表示学习

计算与语言 2023-01-26 v1 人工智能 信息检索 机器学习

摘要

随着生物医学文献和网络数据数量的快速增长,生物医学文本挖掘正变得日益重要。近来,诸如 BERT 之类的词表示模型在研究者中广受欢迎。然而,由于通用语料与生物医学语料的词分布差异显著,很难评估它们在包含生物医学文本的 datasets 上的表现。此外,医学领域存在长尾概念和术语,难以通过语言模型学习。对于中文生物医学文本,由于其结构复杂且短语组合多样,难度更大。本文研究了如何将近期提出的预训练语言模型 BERT 适配于中文生物医学语料,并提出了一种新颖的概念化表示学习方法。我们还发布了一个新的中文生物医学语言理解评测基准(\textbf{ChineseBLUE})。我们考察了中文预训练模型 BERT、BERT-wwm、RoBERTa 以及我们所提方法的有效性。在该基准上的实验结果表明,我们的方法能带来显著提升。我们在 GitHub 上发布了预训练模型:https://github.com/alibaba-research/ChineseBLUE。

关键词

引用

@article{arxiv.2008.10813,
  title  = {Conceptualized Representation Learning for Chinese Biomedical Text Mining},
  author = {Ningyu Zhang and Qianghuai Jia and Kangping Yin and Liang Dong and Feng Gao and Nengwei Hua},
  journal= {arXiv preprint arXiv:2008.10813},
  year   = {2023}
}

备注

WSDM2020 Health Day