AfroXLMR-Social:为非洲语言社交媒体文本适配预训练语言模型
计算与语言
2025-09-23 v3
摘要
构建于各种来源的语言模型是今天NLP进步的基础。然而,对于许多低资源语言,域的多样性常受限,更偏向宗教领域,这会严重影响其在社交媒体等远程且快速演化的域上的性能。域适应预训练(DAPT)和任务适应预训练(TAPT)是减少此类偏差的流行技术,通过持续预训练针对BERT类模型,但尚未在非洲多语言编码器上探索。本文探索了DAPT和TAPT持续预训练方法,用于非洲语言社交媒体域。我们引入AfriSocial,一个大规模社交媒体和新闻域语料库,用于在多个非洲语言上进行持续预训练。利用AfriSocial,我们展示了DAPT在三个主观任务上 consistently 提升性能:情感分析、多标签情感和仇恨言论分类,覆盖19种语言。类似地,利用来自一个任务的数据增强其他相关任务的性能。例如,使用未标记的情感数据(源)为细粒度情感分类任务(目标)训练,可将基线结果提高0.55%至15.11%的F1分数。将这两种方法结合使用(即DAPT+TAPT)进一步提升整体性能。数据和模型资源已在HuggingFace上提供。
引用
@article{arxiv.2503.18247,
title = {AfroXLMR-Social: Adapting Pre-trained Language Models for African Languages Social Media Text},
author = {Tadesse Destaw Belay and Israel Abebe Azime and Ibrahim Said Ahmad and David Ifeoluwa Adelani and Idris Abdulmumin and Abinew Ali Ayele and Shamsuddeen Hassan Muhammad and Seid Muhie Yimam},
journal= {arXiv preprint arXiv:2503.18247},
year = {2025}
}
备注
EMNLP 2025