中文

利用文本-图像对比模型自动检测在线错误信息

机器学习 2023-04-21 v1

摘要

近几十年来,社交媒体网站的使用日益增长,在线传播的新闻文章数量迅速增加,导致了前所未有的潜在欺诈信息规模。尽管大量研究已应用监督机器学习方法来检测此类内容,但缺乏金标准训练数据阻碍了发展。分析单一数据格式(无论是虚假文本描述还是虚假图像)是当前研究的主流方向。然而,真实场景中的错误信息通常以文本-图像对的形式构成,其中新闻文章/新闻标题作为文本内容描述,并通常附有相关图像。鉴于对比学习在无标注数据特征学习方面的强大能力,其作为一种自学习方法已在计算机视觉领域崭露头角并取得成功。本文旨在探索对比学习在错误信息识别领域的应用。我们开发了一种自学习模型,并在名为COSMOS的公开数据集上进行了全面实验。与基线分类器相比,在训练数据不足时,我们的模型在不匹配图像-文本对检测上表现出约10%的优越性能。此外,我们观察到对比学习的稳定性,并建议其使用可大幅减少训练数据数量,同时保持可比的分类结果。

关键词

引用

@article{arxiv.2304.10249,
  title  = {Harnessing the Power of Text-image Contrastive Models for Automatic Detection of Online Misinformation},
  author = {Hao Chen and Peng Zheng and Xin Wang and Shu Hu and Bin Zhu and Jinrong Hu and Xi Wu and Siwei Lyu},
  journal= {arXiv preprint arXiv:2304.10249},
  year   = {2023}
}