WarCov -- 关于社交平台数据的大规模多标签和多模态数据集
计算与语言
2024-06-18 v1 社会与信息网络
摘要
在分类任务中,从原始数据获取到构建适用于评估机器学习模型的数据集,往往需要一系列步骤——这些步骤常常伴随高成本。在自然语言处理领域,初始清洗和转换可自动完成,但获取标签仍需人类专家的合理化输入。因此,尽管许多文章常声称“世界充满数据”,但数据科学家仍面临数据不足的困境。在不断演变的自然语言应用中,这尤为关键,这些应用必须适应新的概念或事件。例如,COVID-19大流行及其相关词汇在2019年之前几乎不可识别。因此,创建新的语言数据集(包括非英语语言)仍至关重要。本工作提出了一个包含3187105篇关于2022年俄乌战争和全球大流行的波兰语社交媒体帖子的数据集。该数据集不仅包含预处理后的文本,还包含图像,可用于多模态识别任务。标签定义帖子的主题,是使用帖子附带的标签创建的。本工作阐述了从数据获取到样本模式识别实验的整个数据集策划过程。
引用
@article{arxiv.2406.10255,
title = {WarCov -- Large multilabel and multimodal dataset from social platform},
author = {Weronika Borek-Marciniec and Pawel Zyblewski and Jakub Klikowski and Pawel Ksieniewicz},
journal= {arXiv preprint arXiv:2406.10255},
year = {2024}
}
备注
13 pages, 6 figures