RoBERTweet:一种用于罗马尼亚语推文的 BERT 语言模型
计算与语言
2023-06-13 v1
摘要
开发用于社交媒体分析的自然语言处理(NLP)系统仍是人工智能研究中的重要课题。本文介绍了 RoBERTweet,首个在罗马尼亚语推文上训练的 Transformer 架构。我们的 RoBERTweet 提供两个版本,遵循 BERT 的 base 和 large 架构。用于预训练模型的语料库对罗马尼亚语 NLP 社区而言是一种新颖之处,由 2008 年至 2022 年收集的所有推文组成。实验表明,在三个以推文为输入的 NLP 任务上——情感检测、性别歧视语言识别和命名实体识别——RoBERTweet 模型优于先前通用领域的罗马尼亚语和多语言语言模型。我们公开提供了我们的模型和新创建的罗马尼亚语推文语料库。
引用
@article{arxiv.2306.06598,
title = {RoBERTweet: A BERT Language Model for Romanian Tweets},
author = {Iulian-Marius Tăiatu and Andrei-Marius Avram and Dumitru-Clementin Cercel and Florin Pop},
journal= {arXiv preprint arXiv:2306.06598},
year = {2023}
}
备注
Accepted at NLDB2023