中文

搭建桥梁:从英语预训练语言模型到马来西亚英语的迁移学习

计算与语言 2024-07-02 v1

摘要

马来西亚英语是一种低资源语种,包含马来语、华语和泰米尔语的元素,除标准英语外。命名实体识别(NER)模型在捕捉马来西亚英语文本中的实体时表现不佳,因为其独特的形态句法适应、语义特征以及代码切换(混合英语和马来语)。鉴于这些差距,本文引入MENmBERT和MENBERT,两种为马来西亚英语量身定制的预训练语言模型,具备上下文理解能力。我们使用手动标注的实体和关系从马来西亚英语新闻文章(MEN)数据集对MENmBERT和MENBERT进行微调。这种微调过程使PLM能够学习捕捉马来西亚英语在NER和RE任务中所必需的细微差别。MENmBERT在NER和RE任务上的性能分别比bert-base-multilingual-cased模型提高了1.52%和26.27%。尽管NER的整体性能提升并不显著,但我们进一步的分析显示,在12个实体标签上表现有显著提升。这些发现表明,针对特定语言和地理区域的语料库对预训练语言模型以提升低资源环境下的NER性能具有重要意义。本文发布的数据集和代码为专注于马来西亚英语的NLP研究提供了宝贵资源。

关键词

引用

@article{arxiv.2407.01374,
  title  = {Bridging the Gap: Transfer Learning from English PLMs to Malaysian English},
  author = {Mohan Raj Chanthran and Lay-Ki Soon and Huey Fang Ong and Bhawani Selvaretnam},
  journal= {arXiv preprint arXiv:2407.01374},
  year   = {2024}
}

备注

Accepted in 9th Workshop on Representation Learning for NLP (Rep4NLP) at ACL 2024