中文

协同双空间感知的图像到文本与文本到图像生成

计算机视觉与模式识别 2025-09-03 v2 人工智能

摘要

在视觉空间理解(VSU)领域,空间图像到文本(SI2T)和空间文本到图像(ST2I)是两个以对偶形式出现的基本任务。由于三维空间特征建模的困难,现有的独立SI2T或ST2I方法在空间理解方面表现不佳。在这项工作中,我们考虑在对偶学习框架下共同建模SI2T和ST2I。在对偶框架中,我们提出用一种新颖的三维场景图(3DSG)表示来表示三维空间场景特征,该表示可以共享并有益于两个任务。此外,受更简单的3D\to图像和3D\to文本过程也分别对称地存在于ST2I和SI2T中的直觉启发,我们提出了空间对偶离散扩散(SD3^3)框架,该框架利用3D\toX过程的中间特征来指导困难的X\to3D过程,从而使整体的ST2I和SI2T相互受益。在视觉空间理解数据集VSD上,我们的系统显著优于主流的T2I和I2T方法。进一步深入分析揭示了我们的对偶学习策略如何取得进步。

关键词

引用

@article{arxiv.2410.15312,
  title  = {Synergistic Dual Spatial-aware Generation of Image-to-Text and Text-to-Image},
  author = {Yu Zhao and Hao Fei and Xiangtai Li and Libo Qin and Jiayi Ji and Hongyuan Zhu and Meishan Zhang and Min Zhang and Jianguo Wei},
  journal= {arXiv preprint arXiv:2410.15312},
  year   = {2025}
}