基于模糊性感知与高阶关系学习的多粒度图像文本匹配
计算机视觉与模式识别
2025-07-15 v1 信息检索
多媒体
摘要
图像文本匹配是连接计算机视觉与自然语言处理之间语义鸿沟的关键技术。然而,现有方法仍面临处理类似实例之间高阶关联和语义模糊性的挑战。这些模糊性源于软正样本(语义相似但标记错误)与软负样本(局部匹配但全局不一致)之间的细微差异,造成匹配不确定性。此外,当前方法未能充分利用训练批次中语义相似实例之间的邻域关系,限制了模型学习高阶共享知识的能力。本文提出了模糊性感知与高阶关系学习框架(AAHR),以解决上述问题。AAHR通过动态聚类原型对比学习构建统一的表示空间,有效缓解了软正样本问题。该框架引入全局与局部特征提取机制以及自适应聚合网络,显著提升了全粒度语义理解能力。此外,AAHR运用类内模态和类间模态相关矩阵全面探讨样本实例之间的邻域关系。它融合图神经网络以增强实例之间的语义交互。此外,AAHR集成动量对比学习以扩充负样本集合。上述组合策略显著提升了模型区分特征的能力。实验结果表明,AAHR在Flickr30K、MSCOCO和ECCV Caption数据集上超越现有SOTA方法,显著提高了图像文本匹配的准确率和效率。该研究的代码和模型检查点均可在https://github.com/Image-Text-Matching/AAHR获取。
引用
@article{arxiv.2507.09256,
title = {Ambiguity-Aware and High-Order Relation Learning for Multi-Grained Image-Text Matching},
author = {Junyu Chen and Yihua Gao and Mingyuan Ge and Mingyong Li},
journal= {arXiv preprint arXiv:2507.09256},
year = {2025}
}
备注
Accepted by the Knowledge-Based Systems(KBS), 2025