中文

面向多语言社交媒体帖子检测的多语言模型

计算与语言 2024-08-14 v1

摘要

本工作提出了一项基于Transformer的自然语言处理模型研究,用于检测包含可验证事实性声明和有害声明的社交媒体帖子。该研究涵盖了包括数据集收集、数据集预处理、架构选择、设置配置、模型训练(微调)、模型测试和实现等等一系列活动。该研究对不同模型进行了全面分析,特别关注多语言模型,即单一模型能够处理英文以及阿拉伯语、保加利亚语、荷兰语、波兰语、捷克语、斯洛伐克语等低资源语言的社交媒体帖子。所得结果经与最先进模型对比验证,比较结果表明所提模型具有较强的鲁棒性。本工作的新颖之处在于开发了能够同时检测有害帖子和包含可验证事实性声明的帖子的多标签多语言分类模型,能够高效实现此功能。

关键词

引用

@article{arxiv.2408.06737,
  title  = {Multilingual Models for Check-Worthy Social Media Posts Detection},
  author = {Sebastian Kula and Michal Gregor},
  journal= {arXiv preprint arXiv:2408.06737},
  year   = {2024}
}