PhoBERT:面向越南语的预训练语言模型
计算与语言
2020-10-06 v3 人工智能
摘要
我们提出了 PhoBERT 的两个版本,PhoBERT-base 与 PhoBERT-large,这是首个公开发布的、为越南语预训练的大规模单语语言模型。实验结果表明,PhoBERT 始终优于近期最佳的多语预训练模型 XLM-R(Conneau 等人,2020),并在多项越南语特定的 NLP 任务中提升了当前最优水平,包括词性标注、依存句法分析、命名实体识别与自然语言推理。我们发布 PhoBERT 以促进越南语 NLP 的未来研究与下游应用。我们的 PhoBERT 模型可在 https://github.com/VinAIResearch/PhoBERT 获取。
引用
@article{arxiv.2003.00744,
title = {PhoBERT: Pre-trained language models for Vietnamese},
author = {Dat Quoc Nguyen and Anh Tuan Nguyen},
journal= {arXiv preprint arXiv:2003.00744},
year = {2020}
}
备注
EMNLP 2020 (Findings)