分词在法语医学掩码语言模型中有多重要?
计算与语言
2024-06-11 v2 人工智能
机器学习
摘要
近年来,子词分词已成为自然语言处理 (NLP) 领域的主流标准,这主要归因于预训练语言模型的广泛使用。这一转变始于字节对编码 (BPE),随后采用了 SentencePiece 和 WordPiece。虽然子词分词始终优于字符级和词级分词,但其成功的确切因素尚不清楚。关键方面,如针对不同任务和语言的最佳分割粒度、数据源对分词器的影响,以及形态信息在印欧语系语言中的作用,仍未得到充分探索。这对于受特定语素组合规则支配的生物医学术语尤为相关。尽管生物医学术语具有黏着性特征,现有语言模型并未明确纳入这一知识,导致常用术语的分词策略不一致。在本文中,我们试图深入探讨法语生物医学领域子词分词的复杂性,涵盖多种 NLP 任务,并 pinpoint 可进一步改进的领域。我们分析了包括 BPE 和 SentencePiece 在内的经典分词算法,并提出了一种原创的分词策略,将富含语素的词分割整合到现有分词方法中。
引用
@article{arxiv.2402.15010,
title = {How Important Is Tokenization in French Medical Masked Language Models?},
author = {Yanis Labrak and Adrien Bazoge and Beatrice Daille and Mickael Rouvier and Richard Dufour},
journal= {arXiv preprint arXiv:2402.15010},
year = {2024}
}
备注
Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024)