开放式多模态检索增强的事实图像生成
计算机视觉与模式识别
2025-10-28 v1 人工智能
信息检索
机器学习
摘要
大型多模态模型(LMMs)在生成逼真且与提示相吻合的图像方面取得了显著进展,但常常产生与可验证知识相矛盾的输出,尤其是在涉及细粒度属性或时效性事件的提示时。传统的检索增强方法试图通过引入外部信息来解决此问题,然而由于依赖静态来源和浅层证据整合,本质上无法在准确且不断演化的知识基础上实现生成。为填补这一差距,我们引入 ORIG,一个 agentic open multimodal retrieval-augmented 框架,用于事实图像生成(FIG),这是一种需要同时实现视觉逼真性和事实 grounding 的新任务。ORIG 迭代检索和过滤来自网络的多模态证据,并逐步将 refined knowledge 整合到丰富的提示中以指导生成。为支持系统化评估,我们构建 FIG-Eval,一个横跨感知、构成和时间维度的十个类别的基准。实验表明,ORIG 在强大的基线之上显著提高了事实一致性和整体图像质量,凸显了开放式多模态检索在事实图像生成中的潜力。
关键词
引用
@article{arxiv.2510.22521,
title = {Open Multimodal Retrieval-Augmented Factual Image Generation},
author = {Yang Tian and Fan Liu and Jingyuan Zhang and Wei Bi and Yupeng Hu and Liqiang Nie},
journal= {arXiv preprint arXiv:2510.22521},
year = {2025}
}
备注
Preprint