中文

BLenDeR:用于深度度量学习中类内图像合成的混合文本嵌入与扩散残差

计算机视觉与模式识别 2026-01-29 v1

摘要

深度生成模型的兴起使能够生成高质量的合成数据。当这些数据用于深度度量学习(DML)中进行数据增强时,可以增加类内多样性并提高下游DML任务的性能。我们引入BLenDeR,这是一种针对DML的扩散采样方法,通过利用基于集合论的并集和交集运算对去噪残差进行可控性地增加类内多样性。并集运算鼓励跨多个提示中出现的任何属性,而交集则通过主成分代理提取公共方向。这些运算使得能够在每个类别内受控地合成多样化的属性组合,解决了现有生成方法的关键局限。在标准DML基准测试上进行的实验表明,BLenDeR在多个数据集和主干网络上均优于最先进的基线方法。具体而言,BLenDeR在CUB-200上实现了Recall@1提升3.7%,在Cars-196上提升1.8%。

关键词

引用

@article{arxiv.2601.20246,
  title  = {BLENDER: Blended Text Embeddings and Diffusion Residuals for Intra-Class Image Synthesis in Deep Metric Learning},
  author = {Jan Niklas Kolf and Ozan Tezcan and Justin Theiss and Hyung Jun Kim and Wentao Bao and Bhargav Bhushanam and Khushi Gupta and Arun Kejariwal and Naser Damer and Fadi Boutros},
  journal= {arXiv preprint arXiv:2601.20246},
  year   = {2026}
}