TurkishBERTweet:用于社交媒体分析的快速可靠大语言模型
计算与语言
2023-12-01 v1 机器学习
社会与信息网络
摘要
土耳其语是世界上最流行的语言之一。该语言在 Twitter、Instagram 或 Tiktok 等社交媒体平台上的广泛使用,以及该国在世界政治中的战略地位,使其对社交网络研究人员和业界具有吸引力。为满足这一需求,我们推出 TurkishBERTweet,这是首个使用近 9 亿条推文构建的土耳其语社交媒体大规模预训练语言模型。该模型与基础 BERT 模型架构相同但输入长度更短,使 TurkishBERTweet 比 BERTurk 更轻量,且推理时间显著更低。我们采用与 RoBERTa 模型相同的方法训练模型,并在两项文本分类任务上评估:情感分类与仇恨言论检测。我们证明 TurkishBERTweet 在泛化性上优于其他可用替代方案,且其更低的推理时间为处理大规模数据集带来显著优势。我们还从成本与性能方面将我们的模型与商业 OpenAI 方案比较,以证明 TurkishBERTweet 是可扩展且具成本效益的解决方案。作为研究的一部分,我们在 MIT 许可证下发布了 TurkishBERTweet 及针对上述任务的微调 LoRA 适配器,以促进未来土耳其语社交媒体研究与应用。我们的 TurkishBERTweet 模型位于:https://github.com/ViralLab/TurkishBERTweet
引用
@article{arxiv.2311.18063,
title = {TurkishBERTweet: Fast and Reliable Large Language Model for Social Media Analysis},
author = {Ali Najafi and Onur Varol},
journal= {arXiv preprint arXiv:2311.18063},
year = {2023}
}
备注
21 pages, 4 figures, 8 tables