中文

基于因果表示推断消除偏差的多模态点击 bait 检测

机器学习 2024-10-11 v1 人工智能

摘要

本文聚焦于检测网络上的点击 bait 帖子。这些帖子常常使用混合模态的引人注目的误information来误导用户点击以获取利润。这会影响用户体验,因而会被内容提供方所屏蔽。为规避检测,恶意创作者会使用技巧将一些无关的非 bait 内容添加至 bait 帖子中,将其包装成合法内容以欺骗检测器。这种内容通常与非 bait 标签存在偏差关联,而传统检测器倾向于基于简单共现来进行预测,而非把握导致恶意行为的内在因素。这种歧evi would容易导致误判。为此,我们提出了一种基于因果推断的新型消除偏差方法。我们首先采用多模态特征来特征化帖子。考虑到这些特征常常与未知偏差混合,我们随后从中解耦出三类潜在因素,包括指示内在 bait 意图的不变因素;反映特定情景下欺骗模式的因果因素;以及非因果噪声。通过消除导致偏差的噪声,我们可以使用不变因素和因果因素来构建具有良好泛化能力的稳健模型。在三个流行数据集上的实验表明,我们的方法有效。

关键词

引用

@article{arxiv.2410.07673,
  title  = {Multimodal Clickbait Detection by De-confounding Biases Using Causal Representation Inference},
  author = {Jianxing Yu and Shiqi Wang and Han Yin and Zhenlong Sun and Ruobing Xie and Bo Zhang and Yanghui Rao},
  journal= {arXiv preprint arXiv:2410.07673},
  year   = {2024}
}