中文

见所不信:前沿图像生成模型、合成视觉证据与现实风险

计算与语言 2026-04-28 v1 人工智能

摘要

前沿图像生成技术正从艺术合成转向合成视觉证据。如 GPT Image 2、Nano Banana Pro、Nano Banana 2、Grok Imagine、Qwen Image 2.0 Pro 和 Seedream 5.0 Lite 等系统综合了高保真渲染、可读排版、参考一致性、编辑控制以及在几种情况下推理或搜索驱动的图像构建。这些能力为设计、教育、可访问性和沟通带来了巨大益处,同时也削弱了社会最常见的信任快捷方式:可信的图片即为可靠记录的信念。本文提供了关于合成视觉风险的源头驱动技术与政策分析。我们首先总结了最近图像模型的公开能力,然后分析了涉及伪造危机图像、名人与公共人物形象、医学扫描、伪造外观文件、合成屏幕截图、网络钓鱼资产以及市场影响消息的公开事件。我们引入了以模型功能为权重的风险框架,将模型功能与金融、医疗、新闻、法律、紧急响应、身份验证和公民讨论等领域的实际伤害联系起来。我们的发现表明,风险更多地来自于保真性、可读文本、身份持久性、快速迭代和分布背景的趋势,而非保真性本身。我们主张采用分层控制:模型端限制、加密来源、可见标签、平台摩擦、行业级验证和事件响应。本文以实用建议结束,为模型提供商、平台、新闻机构、金融机构、医疗系统、法律组织、监管机构和普通用户提供指导。

关键词

引用

@article{arxiv.2604.24197,
  title  = {Seeing Is No Longer Believing: Frontier Image Generation Models, Synthetic Visual Evidence, and Real-World Risk},
  author = {Shuai Wu and Xue Li and Yanna Feng and Yufang Li and Zhijun Wang and Ran Wang},
  journal= {arXiv preprint arXiv:2604.24197},
  year   = {2026}
}

备注

Technical report, 20 pages, 15 figures, 2 tables, 1 algorithm