AxomiyaBERTa:一种音系感知的阿萨姆语 Transformer 模型
计算与语言
2023-05-24 v1
摘要
尽管基于 Transformer 的语言模型在 NLP 中取得了成功,但在低资源或低计算环境下仍需要大量计算资源且表现受限。在本文中,我们提出 AxomiyaBERTa,一种面向阿萨姆语的新型 BERT 模型,阿萨姆语是印度东部一种形态丰富的低资源语言(LRL)。AxomiyaBERTa 仅在掩码语言建模(MLM)任务上训练,没有典型的额外下一句预测(NSP)目标,我们的结果表明,在像阿萨姆语这样的极低资源语言资源匮乏场景下,仅 MLM 便可成功用于一系列任务。AxomiyaBERTa 在命名实体识别等 token 级任务上取得了 SOTA,并借助新颖的嵌入分散器和音系信号分别在 Cloze 式问答和维基标题预测等“更长上下文”任务上表现良好。此外,我们展示了 AxomiyaBERTa 能够利用音系信号应对更具挑战性的任务,例如 ECB+ 语料库翻译版本上的新型跨文档共指任务,我们在该低资源语言上提出了新的 SOTA 结果。我们的源代码和评估脚本可在 https://github.com/csu-signal/axomiyaberta 找到。
引用
@article{arxiv.2305.13641,
title = {AxomiyaBERTa: A Phonologically-aware Transformer Model for Assamese},
author = {Abhijnan Nath and Sheikh Mannan and Nikhil Krishnaswamy},
journal= {arXiv preprint arXiv:2305.13641},
year = {2023}
}
备注
16 pages, 6 figures, 8 tables, appearing in Findings of the ACL: ACL 2023. This version compiled using pdfLaTeX-compatible Assamese script font. Assamese text may appear differently here than in official ACL 2023 proceedings