中文

BERTuit:通过原生Transformer理解Twitter中的西班牙语

计算与语言 2022-06-14 v2 机器学习

摘要

BERT、RoBERTa 或 GPT-3 等基于复杂注意力机制的语言模型的出现,使得在众多场景中处理高度复杂的任务成为可能。然而,当应用于特定领域时,这些模型会遇到相当大的困难。Twitter 等社交网络就是这种情况,这是一个用非正式且复杂的语言书写的、不断变化的信息流,由于上下文所起的重要作用,每条消息即使对人类而言也需要仔细评估才能理解。通过自然语言处理解决该领域的任务涉及严峻的挑战。当强大的最先进多语言语言模型应用于此场景时,语言特有的细微差别往往会在“翻译”中丢失。为应对这些挑战,我们提出了 \textbf{BERTuit},这是迄今为止为西班牙语提出的最大Transformer模型,使用 RoBERTa 优化方法在一个包含 2.3 亿条西班牙语推文的大规模数据集上进行了预训练。我们的动机是提供一个强大的资源,以更好地理解西班牙语 Twitter,并用于专注于该社交网络的应用,特别强调致力于解决该平台错误信息传播的方案。BERTuit 在多项任务上进行了评估,并与 M-BERT、XLM-RoBERTa 和 XLM-T 等极具竞争力的多语言Transformer进行了比较。我们方法的实用性通过应用得以展示,在本例中为:一种可视化骗局群组和分析传播虚假信息作者的零样本方法。错误信息在 Twitter 等平台上以英语以外的语言疯狂传播,这意味着当迁移到英语社区之外时,Transformer的性能可能会受到影响。

关键词

引用

@article{arxiv.2204.03465,
  title  = {BERTuit: Understanding Spanish language in Twitter through a native transformer},
  author = {Javier Huertas-Tato and Alejandro Martin and David Camacho},
  journal= {arXiv preprint arXiv:2204.03465},
  year   = {2022}
}

备注

Support: 1) BBVA FOUNDATION - CIVIC, 2) Spanish Ministry of Science and Innovation - FightDIS (PID2020-117263GB-100) and XAI-Disinfodemics (PLEC2021-007681), 3) Comunidad Autonoma de Madrid - S2018/TCS-4566, 4) European Comission - IBERIFIER (2020-EU-IA-0252), 5) Digital Future Society (Mobile World Capital Barcelona) - DisTrack, 6) UPM - Programa de Excelencia para el Profesorado Universitario