使用一系列有问题的且具有挑战性的生物医学句子比较分词器输出的差异
计算与语言
2023-05-16 v1
摘要
背景与目标:生物医学文本数据正日益可用于研究。分词是许多生物医学文本挖掘流程的初始步骤。分词是将输入的生物医学句子(表示为数字字符序列)解析为一组离散的词语/词符符号的过程,这些符号传达聚焦的语义/句法意义。本研究的目的是探索在一系列具有挑战性的生物医学句子上应用分词器时其输出的差异。方法:Diaz [2015] 引入了 24 个具有挑战性的示例生物医学句子用于比较分词器性能。在本研究中,我们描述性地探讨应用于每个示例生物医学句子的八个分词器输出的差异。本研究中比较的分词器包括 NLTK 空白分词器、NLTK Penn Tree Bank 分词器、Spacy 与 SciSpacy 分词器、Stanza/Stanza-Craft 分词器、UDPipe 分词器以及 R 分词器。结果:对于许多示例,分词器表现相似有效;然而,对于某些示例,返回的输出存在有意义的差异。空白分词器常与其他分词器表现不同。我们观察到实现基于规则系统(例如模式匹配与正则表达式)的分词器与实现用于词符分类的神经架构的分词器在性能上相似。常常导致输出差异最大的具有挑战性的词符,是那些传达实质且聚焦的生物医学/临床意义的词(例如 x-ray、IL-10、TCR/CD3、CD4+ CD8+ 以及 (Ca2+)-regulated)。结论:当来自 Python 与 R 的最先进开源分词器应用于一系列具有挑战性的生物医学示例句子时,我们观察到返回输出的细微差异。
引用
@article{arxiv.2305.08787,
title = {Comparing Variation in Tokenizer Outputs Using a Series of Problematic and Challenging Biomedical Sentences},
author = {Christopher Meaney and Therese A Stukel and Peter C Austin and Michael Escobar},
journal= {arXiv preprint arXiv:2305.08787},
year = {2023}
}