草图与文本协同:用于细粒度图像检索的结构轮廓与描述属性融合
计算机视觉与模式识别
2026-04-20 v1 人工智能
摘要
通过手绘草图或文本描述进行细粒度图像检索仍是一个关键挑战,由于这些模态本身存在差异。手绘草图捕捉复杂的结构轮廓,但缺乏颜色和纹理,而文本虽能提供丰富的颜色和纹理线索,却未能呈现空间轮廓。鼓舞于这些模态的互补性,我们提出了基于草图和文本的图像检索 (STBIR) 框架。通过融合文本中丰富的颜色和纹理线索,以及草图提供的结构轮廓,STBIR 实现了卓越的细粒度检索性能。首先,提出一种由课程学习驱动的鲁棒性增强模块,以增强模型在处理查询质量参差不齐的查询时鲁棒性。其次,我们引入一种基于类别知识的特征空间优化模块,从而显著提升模型的表征能力。最后,我们设计了多阶段跨模态特征对齐机制,以有效缓解跨模态特征对齐的挑战。此外,我们精选了细粒度 STBIR 基准数据集,以严格验证所提框架的有效性,并为后续相关研究提供数据支持。广泛的实验结果表明,所提出的 STBIR 框架显著优于当前最先进的方法。
引用
@article{arxiv.2604.15735,
title = {Sketch and Text Synergy: Fusing Structural Contours and Descriptive Attributes for Fine-Grained Image Retrieval},
author = {Siyuan Wang and Hanchen Gao and Guangming Zhu and Jiang Lu and Yiyue Ma and Tianci Wu and Jincai Huang and Liang Zhang},
journal= {arXiv preprint arXiv:2604.15735},
year = {2026}
}
备注
Image Retrieval, Hand-drawn Sketch, Multi-stage Cross-modal Feature Alignment