OPa-Ma:基于文本引导的 Mamba 模型用于 360 度图像填充
计算机视觉与模式识别
2024-07-16 v1
摘要
本文聚焦于生成给定常规窄视野 (NFoV) 图像的 360 度图像这一近期流行议题。该任务旨在从 NFoV 图像(可由单摄像机或手机拍摄)预测合理且一致的周围环境。现有方法在特征提取和融合方面常基于 transformer 架构,导致显著的内存占用和计算开销。同时,这些方法在维持 360 度图像整体视觉连续性方面存在局限,可能导致纹理和风格生成不一致。为解决上述问题,我们提出一种基于 State-Space Model 的 Mamba 的文本引导填充框架,利用其长序列建模和空间连续性。此外,融入文本信息是引导图像生成的有效策略,可为生成过程增添细节背景并提升多样性。高效提取文本特征并与图像属性集成,是 360 度图像填充中的重要挑战。为此,我们开发了两个模块:视觉-文本一致性精炼器 (VCR) 和全局-局部 Mamba 适配器 (GMA)。VCR 通过融合修改后的文本特征与图像特征来增强上下文丰富性,而 GMA 通过捕获从全局到局部表征的信息流,提供自适应状态选择条件。我们的方法在两个广泛使用的 360 度图像数据集上进行了大量实验,实现了最先进的性能,包括室内和户外场景。
引用
@article{arxiv.2407.10923,
title = {OPa-Ma: Text Guided Mamba for 360-degree Image Out-painting},
author = {Penglei Gao and Kai Yao and Tiandi Ye and Steven Wang and Yuan Yao and Xiaofeng Wang},
journal= {arXiv preprint arXiv:2407.10923},
year = {2024}
}