SenWave: 一种面向 COVID-19 推文的细粒度多语言情感分析数据集
计算与语言
2025-10-10 v1
摘要
COVID-19 大流行的全球影响凸显了对公众情感与反应进行全面理解的必要性。尽管已有众多公开的 COVID-19 数据集,部分数据量高达 1000 亿条,但仍存在标注数据不足以及情感标签粒度粗糙或不恰当的挑战。本文提出 SenWave,一个专门用于分析 COVID-19 推文的细粒度多语言情感分析数据集,涵盖五种语言、十个情感类别。该数据集包含英语和阿拉伯语各 10,000 条标注推文,以及由英语推文翻译而来的西班牙语、法语和意大利语各 30,000 条翻译推文。此外,还包括在 COVID-19 不同波次期间收集的超过 1.05 亿条无标注推文。为实现准确的细粒度情感分类,我们利用标注推文对预训练基于 Transformer 的语言模型进行了微调。本研究对不同语言、国家和主题下的情感演变格局进行了深入分析,揭示了随时间推移的重要洞察。此外,我们评估了数据集与 ChatGPT 的兼容性,展示了其在多种应用中的鲁棒性与 versatility。我们的数据集和配套代码在仓库\footnote{https://github.com/gitdevqiang/SenWave}上公开发布。我们期待此项工作将促进 NLP 社区对复杂事件细粒度情感分析的进一步探索,推动更精细的理解与研究创新。
引用
@article{arxiv.2510.08214,
title = {SenWave: A Fine-Grained Multi-Language Sentiment Analysis Dataset Sourced from COVID-19 Tweets},
author = {Qiang Yang and Xiuying Chen and Changsheng Ma and Rui Yin and Xin Gao and Xiangliang Zhang},
journal= {arXiv preprint arXiv:2510.08214},
year = {2025}
}
备注
13 pages, 13 figures, 6 tables