中文

融合传播结构信息的情报检测方法提升

计算与语言 2025-08-12 v1 社会与信息网络

摘要

预训练语言模型(Pretrained Language Models, PLMs)在各类自然语言处理任务中表现优异,得益于大规模预训练及自注意力机制捕捉长程依赖的能力。然而,其在社交媒体应用任务(如情报检测)上的表现仍不理想。我们认为这源于预训练语料库与社交文本之间的偏差、对独特社交符号的处理不足,以及预训练任务不适合建模传播结构中隐含的用户互动。为此,我们提出一种称为后续互动预测(Post Engagement Prediction, PEP)的继续预训练策略,通过融合传播结构信息来增强语言模型。PEP 使模型预测帖子之间的根、分支和父节点关系,从而捕捉情感与立场互动,这对于情报检测至关重要。我们还策划并公开了大型 Twitter 语料库:TwitterCorpus(269GB 文本),以及两个带有传播结构的无标签声明对话数据集(UTwitter 和 UWeibo)。利用这些资源和 PEP 策略,我们训练了一个针对 Twitter 优化的预训练语言模型,称为 SoLM。大量实验表明,PEP 在通用和社交媒体预训练语言模型上均显著提升情报检测性能,哪怕在少样本场景下也能实现。基准数据集上,PEP 将基线模型的准确率提升 1.0%-3.7%,甚至能够在多个数据集上超越当前最先进的方法。SoLM 单独使用(无需高级模块)也能达到具竞争力的效果,凸显了该策略在学习判别性帖子互动特征方面的有效性。

关键词

引用

@article{arxiv.2508.07209,
  title  = {Enhancing Rumor Detection Methods with Propagation Structure Infused Language Model},
  author = {Chaoqun Cui and Siyuan Li and Kunkun Ma and Caiyan Jia},
  journal= {arXiv preprint arXiv:2508.07209},
  year   = {2025}
}

备注

This paper is accepted by COLING2025