中文

从 Telegram 收集错误信息数据的多模态流水线

社会与信息网络 2022-04-28 v1

摘要

本文介绍了 AI-COVID19 项目的成果,该项目旨在更好地理解社交媒体平台上关于 COVID-19 的错误信息流动。本文报告的研究重点是从积极推广 COVID 相关错误信息的 Telegram 群组中收集数据。我们目前收集的语料库包含来自近一百万条消息的约 2800 万个词。鉴于社交媒体中很大一部分错误信息流动是通过多模态方式(如图像和视频)传播的,我们还开发了一种利用此类渠道的机制,即通过为视频生成自动转录并将图像自动分类为表情包、帖子截图及其他类型图像等类别。该图像分类流水线的准确率约为 87%。

关键词

引用

@article{arxiv.2204.12690,
  title  = {Multimodal Pipeline for Collection of Misinformation Data from Telegram},
  author = {Jose Sosa and Serge Sharoff},
  journal= {arXiv preprint arXiv:2204.12690},
  year   = {2022}
}

备注

Language Resources and Evaluation Conference (LREC) 2022