Stanceosaurus 2.0:对俄语和西班牙语错误信息进行立场分类
计算与语言
2024-02-07 v1 计算机与社会
机器学习
社会与信息网络
摘要
Stanceosaurus 语料库(Zheng 等, 2022)旨在提供从 Twitter 提取的高质量、带注释的 5 类立场数据,适用于分析跨文化和跨语言的错误信息。在 Stanceosaurus 2.0 迭代中,我们将此框架扩展到涵盖俄语和西班牙语。前者因在与西方紧张局势升级及对乌克兰的暴力入侵中普遍存在的错误信息而具有当前重要性。后者则代表了一个在主要社交媒体平台上被大量忽视的巨大社区。通过纳入针对 41 个错误信息声明的额外 3,874 条西班牙语和俄语推文,我们的目标是支持聚焦于这些问题的研究。为了证明这些数据的价值,我们在多语言 BERT 上采用了零样本跨语言迁移,取得了与最初 Stanceosaurus 研究相当的结果,两种语言的宏观 F1 分数均为 43。这强调了立场分类作为识别多元文化错误信息的有效工具的可行性。
引用
@article{arxiv.2402.03642,
title = {Stanceosaurus 2.0: Classifying Stance Towards Russian and Spanish Misinformation},
author = {Anton Lavrouk and Ian Ligon and Tarek Naous and Jonathan Zheng and Alan Ritter and Wei Xu},
journal= {arXiv preprint arXiv:2402.03642},
year = {2024}
}
备注
WNUT2024