中文

Shape2Animal:从自然轮廓生成创意动物

计算机视觉与模式识别 2026-05-08 v4

摘要

人类具有一种独特能力,能够从模糊的刺激信号中捕捉到有意义的模式,这种认知现象称为 pareidolia。本文提出 Shape2Animal 框架以模拟这种想象能力,通过重新解释自然物体轮廓(如云、石头或火焰),将其解读为合理的动物形态。我们的自动化框架首先执行开放词汇分割以提取物体轮廓,并利用视觉语言模型解释语义上恰当的动物概念。随后利用文本到图像扩散模型合成符合输入形状的动物图像,并将其无缝融合到原始场景中,以生成视觉上连贯且位置一致的构图。我们在多样化的真实世界输入上对 Shape2Animal 进行了评估,表明其具有良好的鲁棒性和创造潜力。Shape2Animal 为视觉叙事、教育内容、数字艺术和交互式媒体设计提供了新的机遇。我们的项目页面请见:https://shape2image.github.io

关键词

引用

@article{arxiv.2506.20616,
  title  = {Shape2Animal: Creative Animal Generation from Natural Silhouettes},
  author = {Quoc-Duy Tran and Anh-Tuan Vo and Dinh-Khoi Vo and Tam V. Nguyen and Minh-Triet Tran and Trung-Nghia Le},
  journal= {arXiv preprint arXiv:2506.20616},
  year   = {2026}
}