TwHIN-BERT:一种用于Twitter多语言推文表示的社会化增强预训练语言模型
计算与语言
2023-08-29 v3
摘要
预训练语言模型(PLMs)是自然语言处理应用的基础。大多数现有PLM并非针对社交媒体上含噪的用户生成文本定制,且预训练未考虑社交网络中可用的宝贵社会互动日志。我们提出TwHIN-BERT,一种在Twitter上产品化的多语言语言模型,训练于来自该流行社交网络的域内数据。TwHIN-BERT不同于先前的预训练语言模型,因为它不仅以基于文本的自监督进行训练,还以基于Twitter异质信息网(TwHIN)内丰富社会互动的社会目标进行训练。我们的模型在覆盖超过100种不同语言的70亿条推文上训练,为建模简短、含噪、用户生成的文本提供了有价值的表示。我们在多种多语言社会推荐与语义理解任务上评估我们的模型,并展示相较既有预训练语言模型的显著指标提升。我们向研究社区开源TwHIN-BERT以及我们精心构建的标签预测与社会互动基准数据集。
引用
@article{arxiv.2209.07562,
title = {TwHIN-BERT: A Socially-Enriched Pre-trained Language Model for Multilingual Tweet Representations at Twitter},
author = {Xinyang Zhang and Yury Malkov and Omar Florez and Serim Park and Brian McWilliams and Jiawei Han and Ahmed El-Kishky},
journal= {arXiv preprint arXiv:2209.07562},
year = {2023}
}