XLM-T:Twitter 中的多语言语言模型用于情感分析及更多
计算与语言
2022-05-12 v2
摘要
语言模型在当前 NLP 中无处不在,其多语言能力近期引起了相当关注。然而,当前分析几乎 exclusively 聚焦于(多语言变体的)标准基准,并依赖干净预训练与任务特定语料作为多语言信号。本文引入 XLM-T,一种在 Twitter 中训练和评估多语言语言模型的模型。本文提供:(1)一个新的强多语言基线,由在超过三十种语言的数百万条推文上预训练的 XLM-R(Conneau et al. 2020)模型组成,以及随后在目标任务上微调的起始代码;以及(2)一组八种不同语言的统一情感分析 Twitter 数据集和一个在其上微调的 XLM-T 模型。
引用
@article{arxiv.2104.12250,
title = {XLM-T: Multilingual Language Models in Twitter for Sentiment Analysis and Beyond},
author = {Francesco Barbieri and Luis Espinosa Anke and Jose Camacho-Collados},
journal= {arXiv preprint arXiv:2104.12250},
year = {2022}
}
备注
LREC 2022. Code and data available at https://github.com/cardiffnlp/xlm-t