中文

NLNDE 在 SemEval-2023 任务 12 中的系统:面向低资源多语言情感分析的自适应预训练与源语言选择

计算与语言 2024-01-08 v1

摘要

本文描述了我们为 SemEval-2023 任务 12“基于 Twitter 数据集的低资源非洲语言情感分析”所开发的系统。情感分析是自然语言处理中研究最为广泛的应用之一。然而,多数已有工作仍聚焦于少数高资源语言。由于该任务中训练数据有限,为低资源语言构建可靠的情感分析系统仍具挑战性。本工作中,我们提出在非洲文本上利用语言自适应与任务自适应预训练,并基于一个以非洲语言为中心的预训练语言模型研究带源语言选择的迁移学习。我们的主要发现是:(1)使用小规模但相关的语料将预训练模型适配到目标语言与任务,可将性能显著提升超过 10 个 F1 分数点。(2)在训练中选择具有正向迁移收益的源语言可避免来自不相似语言的有害干扰,从而在多语言与跨语言设定下取得更好结果。在共享任务中,我们的系统在 15 个赛道中的 8 个获胜,尤其在多语言评测中表现最佳。

关键词

引用

@article{arxiv.2305.00090,
  title  = {NLNDE at SemEval-2023 Task 12: Adaptive Pretraining and Source Language Selection for Low-Resource Multilingual Sentiment Analysis},
  author = {Mingyang Wang and Heike Adel and Lukas Lange and Jannik Strötgen and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2305.00090},
  year   = {2024}
}