中文

图像放大语言-视觉模型中的误information 共享

计算与语言 2026-04-29 v2

摘要

随着语言模型和视觉-语言模型(VLMs)成为信息获取和线上交互的核心,人们对其潜在放大误information 的风险日益担忧。人类研究表明,图像会提升信息的可信度和可分享性,引发关于 VLMs 是否 exhibit similar 漏洞的疑问。我们present首个考察图像如何影响 VLMs 重发新闻内容倾向性的研究,以及这种效应如何随模型家族不同而变化,以及人格条件和内容属性如何调制此类行为。我们开发了一种类似“越狱”的提示策略,绕过 VLMs 默认拒绝处理争议性新闻的机制,使其能够在多样化主题下生成重发决定,并能诱导产生包括反社会倾向在内的各种特征。我们在PolitiFact收集的事实核查政治新闻数据集上,对四个最先进的 VLMs 进行评估,该数据集包含图像和真实的可信度标签。我们的实验显示,图像存在会使虚假新闻的重发率提升 14.5%,真实新闻的重发率提升 5.3%。人格条件进一步调制了这种效应:Dark Triad 特征放大了虚假新闻的重发,而共和党倾向的 profile 则降低了对可信度的敏感性。在所测试的模型中,Claude-3-Haiku 对视觉误information 抗性最强。这些发现表明,VLMs 在应对图像时会复制人类类似的偏见,凸显了多模态 AI 系统的新兴风险。它们指向需要考虑视觉影响和人格驱动变异性的评估框架和缓解策略,特别是在 AI 系统塑造公共话语和信息共享的社会技术环境中。

关键词

引用

@article{arxiv.2505.13302,
  title  = {Images Amplify Misinformation Sharing in Vision-Language Models},
  author = {Alice Plebe and Timothy Douglas and Diana Riazi and R. Maria del Rio-Chanona},
  journal= {arXiv preprint arXiv:2505.13302},
  year   = {2026}
}

备注

Accepted for oral presentation at ICWSM 2026