NewsCLIPpings:脱离语境多模态媒体的自动生成
计算机视觉与模式识别
2021-09-23 v2 计算与语言
摘要
在线虚假信息是一个普遍的社会问题,对手依赖从廉价伪造到复杂深度伪造的工具。我们受这样一种威胁场景的驱动:图像被脱离语境使用以支持某一叙事。虽然一些先前的图像—文本不一致检测数据集通过文本操纵生成样本,我们提出了一个图像与文本均未被操纵但错配的数据集。我们引入若干策略,为给定标题自动检索有说服力的图像,捕捉实体或语义语境不一致的实例。我们大规模自动生成的 NewsCLIPpings 数据集:(1)表明机器驱动的图像重新利用如今已是现实威胁;(2)提供了代表新闻中文本与图像错配且能误导人类的挑战性样本。我们在该数据集上基准测试了若干最优(state-of-the-art)多模态模型,并分析了它们在不同预训练域与视觉骨干下的性能。
引用
@article{arxiv.2104.05893,
title = {NewsCLIPpings: Automatic Generation of Out-of-Context Multimodal Media},
author = {Grace Luo and Trevor Darrell and Anna Rohrbach},
journal= {arXiv preprint arXiv:2104.05893},
year = {2021}
}
备注
EMNLP 2021