CAVES:一个用于 COVID 疫苗相关担忧可解释分类与摘要的数据集
计算与语言
2022-11-14 v2 计算机与社会
信息检索
机器学习
摘要
说服人们接种 COVID-19 疫苗是当今一项关键的社会挑战。作为实现该目标的第一步,许多先前工作依赖社交媒体分析来理解人们对这些疫苗的具体担忧,例如潜在副作用、无效性、政治因素等。尽管已有数据集将社交媒体帖子宽泛地分类为反疫苗(Anti-vax)与亲疫苗(Pro-Vax)标签,但据我们所知,尚无数据集根据帖子中提及的具体反疫苗担忧进行标注。本文中,我们构建了 CAVES,首个大规模数据集,包含约 10k 条 COVID-19 反疫苗推文,以多标签设置标注为多种具体反疫苗担忧。这也是首个为每个标签提供解释的多标签分类数据集。此外,该数据集还提供所有推文的按类摘要。我们还在该数据集上进行了初步实验,表明这对于多标签可解释分类与推文摘要而言是一个非常具有挑战性的数据集,一些 SOTA 模型所取得的适中分数即证明了这一点。我们的数据集与代码见:https://github.com/sohampoddar26/caves-data
引用
@article{arxiv.2204.13746,
title = {CAVES: A Dataset to facilitate Explainable Classification and Summarization of Concerns towards COVID Vaccines},
author = {Soham Poddar and Azlaan Mustafa Samad and Rajdeep Mukherjee and Niloy Ganguly and Saptarshi Ghosh},
journal= {arXiv preprint arXiv:2204.13746},
year = {2022}
}
备注
Accepted at SIGIR'22 (Resource Track)