中文

SketchFusion:通过融合基础模型学习通用草图特征

计算机视觉与模式识别 2025-03-19 v1

摘要

虽然基础模型已彻底改变计算机视觉领域,但其对草图理解的有效性仍受限于抽象稀疏视觉输入的独特挑战。通过系统化分析,我们发现两个根本性局限性:Stable Diffusion (SD) 难以从抽象草图中提取有意义特征(与处理照片效果良好相比),且在频率域中表现出显著偏差,抑制了草图理解所需的低频成分。与昂贵的重新训练相比,我们通过战略性地将 SD 与 CLIP 结合来解决这些局限性,后者的强语义理解自然补偿了 SD 的空间频率偏差。通过动态注入 CLIP 特征至 SD 的去噪过程中,并对语义层级的特征进行自适应聚合,我们的方法在草图检索 (+3.35%)、识别 (+1.06%)、分割 (+29.42%) 和对应学习 (+21.22%) 中实现了最先进的性能,展现了在基础模型时代实现真正通用草图特征表示的突破。

关键词

引用

@article{arxiv.2503.14129,
  title  = {SketchFusion: Learning Universal Sketch Features through Fusing Foundation Models},
  author = {Subhadeep Koley and Tapas Kumar Dutta and Aneeshan Sain and Pinaki Nath Chowdhury and Ayan Kumar Bhunia and Yi-Zhe Song},
  journal= {arXiv preprint arXiv:2503.14129},
  year   = {2025}
}

备注

Accepted in CVPR 2025. Project page available at https://subhadeepkoley.github.io/SketchFusion/