中文

BioSentVec:面向生物医学文本的句子嵌入构建

计算与语言 2020-01-28 v6 人工智能 机器学习

摘要

句子嵌入已成为当今自然语言处理(NLP)系统的重要组成部分,尤其是与先进的深度学习方法相结合时。尽管通用领域已有预训练的句子编码器,但迄今为止尚无针对生物医学文本的此类资源。在本工作中,我们推出 BioSentVec:首个开放句子嵌入集,使用来自 PubMed 学术文献和 MIMIC-III 临床数据库中临床记录的三千多万篇文档训练而成。我们在不同文本体裁的两个句子对相似度任务中评估了 BioSentVec 嵌入。我们的基准测试结果表明,与其他有竞争力的替代方案相比,BioSentVec 嵌入能更好地捕捉句子语义,并在两项任务中均达到最先进的性能。我们期望 BioSentVec 能促进生物医学文本挖掘的研究与开发,并补充现有的生物医学词嵌入资源。BioSentVec 已在 https://github.com/ncbi-nlp/BioSentVec 公开提供。

关键词

引用

@article{arxiv.1810.09302,
  title  = {BioSentVec: creating sentence embeddings for biomedical texts},
  author = {Qingyu Chen and Yifan Peng and Zhiyong Lu},
  journal= {arXiv preprint arXiv:1810.09302},
  year   = {2020}
}

备注

5 pages, 3 tables and 2 figures accepted by The Seventh IEEE International Conference on Healthcare Informatics (ICHI 2019)