HP-BERT:基于语言模型的社交媒体印度教恐惧症纵向研究框架
计算与语言
2025-10-07 v2 社会与信息网络
摘要
在COVID-19疫情期间,社区紧张局势加剧,导致针对包括印度教社区在内的各种宗教群体的歧视性情绪加剧。语言模型的最新进展显示出社交媒体分析的潜力,可用于社交媒体平台(如X(Twitter))的纵向研究。我们提出了一个计算框架,用于分析COVID-19期间的反印度教情绪(印度教恐惧症),引入了一种用于X平台纵向分析的滥用检测和情感分析方法。我们整理并发布了包含8000条标注和人工验证推文的“印度教恐惧症COVID-19 X数据集”。随后,我们利用该数据集开发了印度教恐惧症BERT(HP-BERT)模型,达到了94.72%的准确率,优于基于Transformer的基线语言模型。该模型通过额外的微调整合了多标签情感分析能力。我们的分析涵盖了来自六个国家(包括澳大利亚、巴西、印度、印度尼西亚、日本和英国)的约2740万条推文。统计分析显示,COVID-19病例增加与印度教恐惧症内容数量之间存在中等相关性(r = 0.312-0.428),突显了疫情相关压力如何可能助长歧视性言论。本研究提供了COVID-19危机期间社交媒体上基于宗教的歧视的证据。
引用
@article{arxiv.2501.05482,
title = {HP-BERT: A framework for longitudinal study of Hinduphobia on social media via language models},
author = {Ashutosh Singh and Rohitash Chandra},
journal= {arXiv preprint arXiv:2501.05482},
year = {2025}
}