中文

XLM-T:Twitter 中的多语言语言模型用于情感分析及更多

计算与语言 2022-05-12 v2

摘要

语言模型在当前 NLP 中无处不在,其多语言能力近期引起了相当关注。然而,当前分析几乎 exclusively 聚焦于(多语言变体的)标准基准,并依赖干净预训练与任务特定语料作为多语言信号。本文引入 XLM-T,一种在 Twitter 中训练和评估多语言语言模型的模型。本文提供:(1)一个新的强多语言基线,由在超过三十种语言的数百万条推文上预训练的 XLM-R(Conneau et al. 2020)模型组成,以及随后在目标任务上微调的起始代码;以及(2)一组八种不同语言的统一情感分析 Twitter 数据集和一个在其上微调的 XLM-T 模型。

关键词

引用

@article{arxiv.2104.12250,
  title  = {XLM-T: Multilingual Language Models in Twitter for Sentiment Analysis and Beyond},
  author = {Francesco Barbieri and Luis Espinosa Anke and Jose Camacho-Collados},
  journal= {arXiv preprint arXiv:2104.12250},
  year   = {2022}
}

备注

LREC 2022. Code and data available at https://github.com/cardiffnlp/xlm-t