中文

编辑媒体理解框架:关于视觉错误信息的意图与影响的推理

计算与语言 2025-03-28 v2 计算机视觉与模式识别

摘要

从“深度伪造”到欺骗性的简单编辑,多模态虚假信息是一个重要的社会问题。然而与此同时,绝大多数媒体编辑是无害的——例如带滤镜的度假照片。此例与传播虚假信息的有害编辑之间的区别在于意图。识别并描述这种意图是当今人工智能系统的一大挑战。我们提出了编辑媒体理解任务,要求模型回答捕捉图像编辑意图与影响的开放式问题。我们为该项任务引入了一个数据集 EMU,包含以丰富自然语言写成的 4.8 万个问答对。我们评估了多种视觉-语言模型在该任务上的表现,并提出了一种新模型 PELICAN,其构建于近期预训练多模态表示的进展之上。我们的模型在数据集上取得了有前景的结果,人类对其回答的准确性评分为 40.35%。与此同时,仍有大量工作待完成——人类在 93.56% 的情况下更偏好人工标注的说明——我们提供了凸显进一步改进方向的分析。

关键词

引用

@article{arxiv.2012.04726,
  title  = {Edited Media Understanding Frames: Reasoning About the Intent and Implications of Visual Misinformation},
  author = {Jeff Da and Maxwell Forbes and Rowan Zellers and Anthony Zheng and Jena D. Hwang and Antoine Bosselut and Yejin Choi},
  journal= {arXiv preprint arXiv:2012.04726},
  year   = {2025}
}

备注

ACL 2021