中文

TwHIN-BERT:一种用于Twitter多语言推文表示的社会化增强预训练语言模型

计算与语言 2023-08-29 v3

摘要

预训练语言模型(PLMs)是自然语言处理应用的基础。大多数现有PLM并非针对社交媒体上含噪的用户生成文本定制,且预训练未考虑社交网络中可用的宝贵社会互动日志。我们提出TwHIN-BERT,一种在Twitter上产品化的多语言语言模型,训练于来自该流行社交网络的域内数据。TwHIN-BERT不同于先前的预训练语言模型,因为它不仅以基于文本的自监督进行训练,还以基于Twitter异质信息网(TwHIN)内丰富社会互动的社会目标进行训练。我们的模型在覆盖超过100种不同语言的70亿条推文上训练,为建模简短、含噪、用户生成的文本提供了有价值的表示。我们在多种多语言社会推荐与语义理解任务上评估我们的模型,并展示相较既有预训练语言模型的显著指标提升。我们向研究社区开源TwHIN-BERT以及我们精心构建的标签预测与社会互动基准数据集。

关键词

引用

@article{arxiv.2209.07562,
  title  = {TwHIN-BERT: A Socially-Enriched Pre-trained Language Model for Multilingual Tweet Representations at Twitter},
  author = {Xinyang Zhang and Yury Malkov and Omar Florez and Serim Park and Brian McWilliams and Jiawei Han and Ahmed El-Kishky},
  journal= {arXiv preprint arXiv:2209.07562},
  year   = {2023}
}