ControBench:面向社交网络争议话语分析的交互感知基准
计算与语言
2026-05-04 v1 机器学习
摘要
理解人们在意识形态分歧的在线论辩方式对于研究政治极化、误导信息和内容监管至关重要。现有数据集只能捕捉问题的部分方面:一些保留文本但忽略交互结构,一些建模结构但缺乏丰富的语义,其他则代表对话但缺乏稳定的用户层级意识形态身份。我们介绍 ControBench,这是一个结合异构社交交互图和丰富文本语义的争议话语分析基准。基于关于特朗普、堕胎和宗教话题的 Reddit 讨论构建,ControBench 包含 7,370 名用户、1,783 篇帖子和 26,525 条交互。该图包含用户和帖子节点通过语义丰富边相连;特别是,用户-评论-用户边编码了一条回复及其响应的父评论,保留了局部论证语境。用户标签来源于自声明的 Reddit flair,为意识形态身份提供了可扩展的代理,而无需人工标注。 resulting 数据集 exhibit low or negative adjusted homophily (Trump: -0.77, Abortion: 0.06, Religion: 0.04),反映真实世界辩论的交叉结构。我们评估了图神经网络、预训练语言模型和大语言模型在 ControBench 上的表现,观察到不同主题和模型家族之间存在不同的性能模式,尤其是在意识形态边界模糊时。这些结果将 ControBench 定位为争议话语分析的一个具有挑战性和现实性的基准。
引用
@article{arxiv.2605.00513,
title = {ControBench: An Interaction-Aware Benchmark for Controversial Discourse Analysis on Social Networks},
author = {Ta Thanh Thuy and Jiaqi Zhu and Xuan Liu and Lin Shang and Reihaneh Rabbany and Guillaume Rabusseau and Lihui Chen and Zheng Yilun and Sitao Luan},
journal= {arXiv preprint arXiv:2605.00513},
year = {2026}
}