Hummingbird:基于多模态上下文对齐的高保真图像生成
计算机视觉与模式识别
2025-06-10 v2
摘要
虽然扩散模型在生成物体导向任务中具有强大的生成高质量、多样化合成数据的能力,但现有方法在场景感知任务(如视觉问答VQA与人体-物体交互HOI推理)中表现不足,此时必须确保生成图像在多模态上下文(即带随文本指导查询的参考图像)下,准确保留场景属性。为此,我们提出 ,这是首个在给定多模态上下文后,能够生成高度多样化图像(相对于参考图像)且通过准确保留文本指导下参考图像中的场景属性(如物体交互与空间关系),实现高保真度的扩散式图像生成器。Hummingbird 采用新颖的多模态上下文评估器(Multimodal Context Evaluator),同时优化我们提出的全局语义与细粒度一致性奖励(Global Semantic and Fine-grained Consistency Rewards),确保生成图像在文本指导下保持参考图像的场景属性一致性,同时维持多样性。作为首个在多模态上下文中维持多样性与保真度的模型,我们引入新的基准构建,集成MME感知数据集与Bongard HOI 数据集。基准实验表明,Hummingbird 在所有现有方法中均实现卓越的保真度与多样性,验证了其作为稳健的多模态上下文对齐图像生成器在复杂视觉任务中的潜力。项目页面:https://roar-ai.github.io/hummingbird
引用
@article{arxiv.2502.05153,
title = {Hummingbird: High Fidelity Image Generation via Multimodal Context Alignment},
author = {Minh-Quan Le and Gaurav Mittal and Tianjian Meng and A S M Iftekhar and Vishwas Suryanarayanan and Barun Patra and Dimitris Samaras and Mei Chen},
journal= {arXiv preprint arXiv:2502.05153},
year = {2025}
}
备注
Accepted to ICLR 2025. Project page with code release: https://roar-ai.github.io/hummingbird