Diff-SBSR:用于零样本草图基三维形状检索的多模态特征增强扩散模型
计算机视觉与模式识别
2026-04-22 v1
摘要
本文首次探索了文本到图像扩散模型用于零样本草图基三维形状检索(ZS-SBSR)的方法。现有的草图基三维形状检索方法在零样本设置下难以应对,因为缺乏类别监督且草图输入极度稀疏。我们的关键洞察是,大规模预训练扩散模型天然具备开放词汇能力和强大的形状偏置,使其非常适合零样本视觉检索。我们利用冻结的Stable Diffusion主干网络,从 sketch 和渲染的三维视图的中间 U-Net 层中提取和聚合判别性表示。扩散模型因草图的极度抽象和稀疏性而难以处理,这与自然图像之间的显著领域差距相compounded。为解决这一限制且不进行高成本重新训练,我们引入一种多模态特征增强策略,通过来自 CLIP 的补充视觉和文本线索来条件化冻结扩散主干网络,显式增强语义上下文捕获能力并聚焦于草图轮廓。具体而言,我们注入来自预训练 CLIP 视觉编码器派生的全局和局部视觉特征,并通过结合可学习的软提示与 BLIP 生成的硬文本描述来增富文本指引。此外,我们采用 Circle-T loss 动态强化正负样本对的吸引,一旦负样本足够分离,即可适应草图噪声,实现更有效的草图-3D 对齐。广泛的实验表明,我们的方法在 ZS-SBSR 上 consistently 超过了最新方法。
引用
@article{arxiv.2604.19135,
title = {Diff-SBSR: Learning Multimodal Feature-Enhanced Diffusion Models for Zero-Shot Sketch-Based 3D Shape Retrieval},
author = {Hang Cheng and Fanhe Dong and Long Zeng},
journal= {arXiv preprint arXiv:2604.19135},
year = {2026}
}