中文

NewsCLIPpings:脱离语境多模态媒体的自动生成

计算机视觉与模式识别 2021-09-23 v2 计算与语言

摘要

在线虚假信息是一个普遍的社会问题,对手依赖从廉价伪造到复杂深度伪造的工具。我们受这样一种威胁场景的驱动:图像被脱离语境使用以支持某一叙事。虽然一些先前的图像—文本不一致检测数据集通过文本操纵生成样本,我们提出了一个图像与文本均未被操纵但错配的数据集。我们引入若干策略,为给定标题自动检索有说服力的图像,捕捉实体或语义语境不一致的实例。我们大规模自动生成的 NewsCLIPpings 数据集:(1)表明机器驱动的图像重新利用如今已是现实威胁;(2)提供了代表新闻中文本与图像错配且能误导人类的挑战性样本。我们在该数据集上基准测试了若干最优(state-of-the-art)多模态模型,并分析了它们在不同预训练域与视觉骨干下的性能。

关键词

引用

@article{arxiv.2104.05893,
  title  = {NewsCLIPpings: Automatic Generation of Out-of-Context Multimodal Media},
  author = {Grace Luo and Trevor Darrell and Anna Rohrbach},
  journal= {arXiv preprint arXiv:2104.05893},
  year   = {2021}
}

备注

EMNLP 2021