VIP:多模态大语言模型赋能的通用图像外推
计算机视觉与模式识别
2024-12-02 v3
摘要
本文聚焦于解决图像外推问题,其目标是根据图像的中心内容推断周围部分。尽管近期工作取得了有希望的性能,但缺乏通用性和定制化能力阻碍了其在更广泛场景中的实际应用。因此,本文提出了一种新颖的图像外推框架,能够根据用户需求定制结果。首先,我们利用多模态大语言模型(MLLM)自动提取和组织给定图像中掩码部分和未掩码部分的相应文本描述。相应地,引入获得的文本提示,赋予我们的模型定制外推结果的能力。此外,我们精心设计了一个特殊的交叉注意力模块,即中心-整体-周围(CTS),以进一步增强图像特定空间区域与文本提示对应部分之间的交互。注意,与大多数现有方法不同,我们的方法非常资源高效,因为它仅在现成的稳定扩散(SD)模型上进行微调,而非从头训练。最后,在三个常用数据集(即Scenery、Building和WikiArt)上的实验结果表明,我们的模型显著超越了SoTA方法。此外,列出了多样化的外推结果以展示其定制能力。
引用
@article{arxiv.2406.01059,
title = {VIP: Versatile Image Outpainting Empowered by Multimodal Large Language Model},
author = {Jinze Yang and Haoran Wang and Zining Zhu and Chenglong Liu and Meng Wymond Wu and Mingming Sun},
journal= {arXiv preprint arXiv:2406.01059},
year = {2024}
}
备注
Accepted by ACCV-2025, Our source code is available at: https://github.com/ucasyjz/VIP, 15 pages