生物医学语言模型对次优分词的鲁棒性
计算与语言
2023-07-11 v3
摘要
与通用英语不同,生物医学术语中的许多概念是由生物医学专业人员在近代设计的,其目的是精确且简洁。这通常通过拼接有意义的生物医学语素来创建新的语义单元来实现。然而,大多数现代生物医学语言模型(LMs)在使用标准领域特定分词器进行预训练时,仅基于大规模生物医学语料统计得到,而未显式利用生物医学语言的黏着特性。在本工作中,我们首先发现标准开放领域与生物医学分词器大多无法将生物医学术语切分为有意义的成分。因此,我们假设使用能更准确切分生物医学术语的分词器将提升生物医学 LMs 在下游生物医学 NLP 任务上的表现,尤其是直接涉及生物医学术语的任务,如命名实体识别(NER)与实体链接。令人惊讶的是,我们发现使用更准确的生物医学分词器预训练生物医学 LM,并未改善语言模型的实体表示质量,这通过若干内在与外在度量(如掩码语言建模预测(MLM)准确率以及 NER 和实体链接性能)得以衡量。这些定量发现,加之一项更直接探究实体表示质量的案例研究,表明生物医学预训练过程对次优分词实例具有相当强的鲁棒性。
引用
@article{arxiv.2306.17649,
title = {Biomedical Language Models are Robust to Sub-optimal Tokenization},
author = {Bernal Jiménez Gutiérrez and Huan Sun and Yu Su},
journal= {arXiv preprint arXiv:2306.17649},
year = {2023}
}
备注
BioNLP @ ACL 2023