从 Telegram 收集错误信息数据的多模态流水线
社会与信息网络
2022-04-28 v1
摘要
本文介绍了 AI-COVID19 项目的成果,该项目旨在更好地理解社交媒体平台上关于 COVID-19 的错误信息流动。本文报告的研究重点是从积极推广 COVID 相关错误信息的 Telegram 群组中收集数据。我们目前收集的语料库包含来自近一百万条消息的约 2800 万个词。鉴于社交媒体中很大一部分错误信息流动是通过多模态方式(如图像和视频)传播的,我们还开发了一种利用此类渠道的机制,即通过为视频生成自动转录并将图像自动分类为表情包、帖子截图及其他类型图像等类别。该图像分类流水线的准确率约为 87%。
引用
@article{arxiv.2204.12690,
title = {Multimodal Pipeline for Collection of Misinformation Data from Telegram},
author = {Jose Sosa and Serge Sharoff},
journal= {arXiv preprint arXiv:2204.12690},
year = {2022}
}
备注
Language Resources and Evaluation Conference (LREC) 2022