中文

PhayaThaiBERT:通过未同化外来词增强泰语预训练语言模型

计算与语言 2025-11-18 v2 人工智能

摘要

尽管 WangchanBERTa 已成为基于 transformer 的泰语语言建模的事实标准,其在理解外来词(最显著为英语词,在许多语境中常不经正字法同化便借入泰语)方面仍有不足。我们确定 WangchanBERTa 分词器中外语词汇的缺失是这些不足的主要根源。随后,我们通过从 XLM-R 的预训练分词器进行词汇迁移来扩展 WangchanBERTa 的词汇表,并使用扩展后的分词器在新数据集上从 WangchanBERTa 的检查点开始预训练新模型,该数据集大于训练 WangchanBERTa 所用数据集。我们的结果表明,我们的新预训练模型 PhayaThaiBERT 在许多下游任务与数据集上优于 WangchanBERTa。

关键词

引用

@article{arxiv.2311.12475,
  title  = {PhayaThaiBERT: Enhancing a Pretrained Thai Language Model with Unassimilated Loanwords},
  author = {Panyut Sriwirote and Jalinee Thapiang and Vasan Timtong and Attapol T. Rutherford},
  journal= {arXiv preprint arXiv:2311.12475},
  year   = {2025}
}

备注

revised to fix formatting error, content unchanged