中文

Image Anything:迈向推理连贯且免训练的多模态图像生成

计算机视觉与模式识别 2024-02-01 v1 图形学

摘要

人类感知与理解的多面性表明,当我们思考时,身体能够自然地接收任意感官组合(即模态),并在大脑中形成美丽的画面。例如,当我们看到猫舍并同时感知到猫的呼噜声时,大脑能够构建出一幅猫在猫舍中的画面。直觉上,生成式AI模型应具备人类的通用性,能够高效且协同地从任意模态组合中生成图像。本文提出了ImgAny,一种新颖的端到端多模态生成模型,能够模仿人类推理并生成高质量图像。我们的方法作为首次尝试,能够高效且灵活地接收七种模态的任意组合,涵盖语言、音频以及视觉模态(包括图像、点云、热成像、深度和事件数据)。我们的核心思想受人类认知过程启发,涉及在实体和属性两个层面整合与协调多种输入模态,且无需跨模态的特定微调。相应地,我们的方法带来了两个新颖的免训练技术分支:1)实体融合分支确保输入与输出之间的连贯性。它借助我们专门构建的实体知识图谱,从多模态表示中提取实体特征;2)属性融合分支巧妙地保留并处理属性。它通过我们提出的属性知识图谱,高效地融合来自不同输入模态的各异属性。最后,实体和属性特征被自适应地融合,作为预训练Stable Diffusion模型的条件输入以生成图像。在多种模态组合下的广泛实验证明了其卓越的视觉内容创建能力。

关键词

引用

@article{arxiv.2401.17664,
  title  = {Image Anything: Towards Reasoning-coherent and Training-free Multi-modal Image Generation},
  author = {Yuanhuiyi Lyu and Xu Zheng and Lin Wang},
  journal= {arXiv preprint arXiv:2401.17664},
  year   = {2024}
}