基于自精炼对应的跨模态主动互补学习
计算机视觉与模式识别
2024-01-09 v2 机器学习
摘要
近年来,图文匹配因其在视觉与文本模态间潜在对应理解中的基础性而受到学术界与工业界越来越多的关注。然而,多数现有方法隐式假设训练对良好对齐,忽视了普遍存在的标注噪声(即噪声对应,NC),从而不可避免地导致性能下降。尽管一些方法试图解决此类噪声,仍面临两个挑战性问题:过度记忆/过拟合,以及对 NC 不可靠的纠正,尤其在高度噪声下。为应对这两问题,我们提出一种广义的跨模态鲁棒互补学习框架(CRCL),其得益于新颖的主动互补损失(ACL)与高效的自精炼对应纠正(SCC)以提升现有方法的鲁棒性。具体而言,ACL 利用主动与互补学习损失降低提供错误监督的风险,在理论与实验上均证明了对 NC 的鲁棒性。SCC 利用带动量纠正的多次自精炼过程扩大纠正对应的感受野,从而缓解误差累积并实现准确稳定的纠正。我们在 Flickr30K、MS-COCO 与 CC152K 三个图文基准上开展大量实验,验证了我们的 CRCL 对合成与真实世界噪声对应均具有优越鲁棒性。
引用
@article{arxiv.2310.17468,
title = {Cross-modal Active Complementary Learning with Self-refining Correspondence},
author = {Yang Qin and Yuan Sun and Dezhong Peng and Joey Tianyi Zhou and Xi Peng and Peng Hu},
journal= {arXiv preprint arXiv:2310.17468},
year = {2024}
}
备注
This paper is accepted by NeurIPS 2023