中文

基于专家合作的隐形图像-文本检索

计算机视觉与模式识别 2026-04-03 v1 图像与视频处理

摘要

隐形场景理解(CSU)因其广泛的实际意义而引起广泛关注。然而,在该领域,鲁棒的图像-文本跨模态对齐仍未得到充分探索,阻碍了对隐形场景及其相关应用的深入理解。为此,我们聚焦于典型的图像-文本检索任务,提出了新任务称为隐形感知图像-文本检索(CA-ITR)。我们首先构建了一个专门的隐形图像-文本检索数据集(CamoIT),包含约10.5K个样本,具有多层次文本注释。在CamoIT上的基准结果揭示了CA-ITR对现有前沿检索技术的底层挑战,这些挑战主要由对象隐形特性以及复杂图像内容所致。作为解决方案,我们提出了一种隐形专家协作网络(CECNet),其特点是双分支视觉编码器:一个分支捕获整体图像表示,另一个分支包含专门的模型以注入隐形对象的表示。我们采用一种新颖的置信度条件图注意力(C²GA)机制,以利用跨分支的互补性。比较实验表明,CECNet实现了约29%的整体CA-ITR准确率提升,超过了七个代表性检索模型。该数据集和代码将在https://github.com/jiangyao-scu/CA-ITR上提供。

关键词

引用

@article{arxiv.2604.01251,
  title  = {Camouflage-aware Image-Text Retrieval via Expert Collaboration},
  author = {Yao Jiang and Zhongkuan Mao and Xuan Wu and Keren Fu and Qijun Zhao},
  journal= {arXiv preprint arXiv:2604.01251},
  year   = {2026}
}