PhayaThaiBERT:通过未同化外来词增强泰语预训练语言模型
计算与语言
2025-11-18 v2 人工智能
摘要
尽管 WangchanBERTa 已成为基于 transformer 的泰语语言建模的事实标准,其在理解外来词(最显著为英语词,在许多语境中常不经正字法同化便借入泰语)方面仍有不足。我们确定 WangchanBERTa 分词器中外语词汇的缺失是这些不足的主要根源。随后,我们通过从 XLM-R 的预训练分词器进行词汇迁移来扩展 WangchanBERTa 的词汇表,并使用扩展后的分词器在新数据集上从 WangchanBERTa 的检查点开始预训练新模型,该数据集大于训练 WangchanBERTa 所用数据集。我们的结果表明,我们的新预训练模型 PhayaThaiBERT 在许多下游任务与数据集上优于 WangchanBERTa。
引用
@article{arxiv.2311.12475,
title = {PhayaThaiBERT: Enhancing a Pretrained Thai Language Model with Unassimilated Loanwords},
author = {Panyut Sriwirote and Jalinee Thapiang and Vasan Timtong and Attapol T. Rutherford},
journal= {arXiv preprint arXiv:2311.12475},
year = {2025}
}
备注
revised to fix formatting error, content unchanged