深度提升学习:一种全新的图像-文本匹配协同方法
计算机视觉与模式识别
2024-04-30 v1 多媒体
摘要
由于模态间异构的语义多样性和三元组内距离可分性不足,图像-文本匹配仍然是一项具有挑战性的任务。与以往专注于增强多模态表示或利用跨模态对应关系以实现更精确检索的方法不同,本文旨在以提升的方式利用对等分支之间的知识迁移,以寻求更强大的匹配模型。具体来说,我们提出了一种全新的深度提升学习 (DBL) 算法,其中首先训练一个锚点分支以提供对数据属性的洞察,然后目标分支获得更高级的知识以开发最优特征和距离度量。具体而言,锚点分支最初学习正负对之间的绝对或相对距离,提供对特定网络和数据分布的基础理解。基于此知识,目标分支同时被赋予更具适应性的边界约束,以进一步扩大匹配与不匹配样本之间的相对距离。大量实验验证了我们的 DBL 能够基于图像-匹配领域各种最新的最先进模型实现令人印象深刻且一致的改进,并优于相关的流行协同策略,例如传统蒸馏、互学习和对比学习。除此之外,我们证实 DBL 可以无缝集成到它们的训练场景中,并在相同的计算成本下实现更优越的性能,展示了我们提出的方法的灵活性和广泛适用性。我们的代码公开于:https://github.com/Paranioar/DBL。
引用
@article{arxiv.2404.18114,
title = {Deep Boosting Learning: A Brand-new Cooperative Approach for Image-Text Matching},
author = {Haiwen Diao and Ying Zhang and Shang Gao and Xiang Ruan and Huchuan Lu},
journal= {arXiv preprint arXiv:2404.18114},
year = {2024}
}
备注
12 pages, 9 figures, Accepted by TIP2024