ANGOFA:利用OFA嵌入初始化和合成数据构建安哥拉语言模型
计算与语言
2026-05-08 v2 人工智能
摘要
近年来,预训练语言模型的发展势头强劲,展示了其跨越语言障碍、促进多语言知识迁移的能力。然而,这一进展主要绕过了极低资源语言的纳入,在多语言格局中造成了显著空白。本文通过引入四个专门针对安哥拉语言微调的定制预训练语言模型来填补这一空白,采用了多语言自适应微调方法。本文调查了信息丰富的嵌入初始化和合成数据在提升多语言自适应微调模型下游任务性能中的作用。我们在SOTA AfroXLMR-base(通过多语言自适应微调开发)和OFA(一种有效的嵌入初始化)的基础上分别提升了12.3和3.8个点。
引用
@article{arxiv.2404.02534,
title = {ANGOFA: Leveraging OFA Embedding Initialization and Synthetic Data for Angolan Language Model},
author = {Osvaldo Luamba Quinjica and David Ifeoluwa Adelani},
journal= {arXiv preprint arXiv:2404.02534},
year = {2026}
}
备注
Accepted at AfricaNLP 2024