中文

Topo Goes Political:基于TDA的Reddit政治数据类别不平衡争议检测

社会与信息网络 2025-03-06 v1

摘要

互联网政治讨论中有争议内容的检测是维护健康数字话语的关键挑战。与现有大量依赖合成平衡数据的研究不同,我们的工作保留了争议与非争议帖子的自然分布。这种现实中的不平衡凸显了实际部署所需解决的核心挑战。我们的研究重新评估了检测争议内容的成熟方法。我们整理了自己的数据集,聚焦于印度政治背景,保留了争议内容的自然分布,数据集中仅有12.9%的帖子属于争议内容。这种差异反映了真实世界政治讨论中的实际不平衡,并揭示了现有评估方法的关键局限。在模拟数据不平衡的数据集上进行基准测试对确保实际应用至关重要。因此,在本工作中,(i)我们发布了我们的数据集,强调类别不平衡,聚焦于印度政治背景;(ii)我们在该数据集上评估了该领域的现有方法,并证明了它们在不平衡设置下的局限性;(iii)我们引入了一个直观的指标来衡量模型对类别不平衡的鲁棒性;(iv)我们还引入了拓扑数据分析领域,特别是持续同调的思想,来筛选能够提供更丰富数据表示的特征。此外,我们将使用拓扑特征训练的模型与现有基线方法进行了基准比较。

关键词

引用

@article{arxiv.2503.03500,
  title  = {Topo Goes Political: TDA-Based Controversy Detection in Imbalanced Reddit Political Data},
  author = {Arvindh Arun and Karuna K Chandra and Akshit Sinha and Balakumar Velayutham and Jashn Arora and Manish Jain and Ponnurangam Kumaraguru},
  journal= {arXiv preprint arXiv:2503.03500},
  year   = {2025}
}