用于弱监督文本到人物图像匹配的双粒度跨模态身份关联
计算机视觉与模式识别
2025-07-10 v1 机器学习
多媒体
摘要
弱监督文本到人物图像匹配作为降低模型对大规模人工标注样本依赖的关键方法,具有重要的研究价值。然而,现有方法难以预测复杂的多对一身份关系,严重限制了性能提升。为解决这一挑战,我们提出了一种局部与全局双粒度身份关联机制。具体而言,在局部层面,我们在 batch 内显式建立跨模态身份关系,强化不同模态之间的身份约束,使模型能够更好地捕捉细微差异和关联。在全局层面,我们构建了一个以视觉模态为锚点的动态跨模态身份关联网络,引入基于置信度的动态调整机制,有效提升了模型识别弱关联样本的能力,同时提高了整体灵敏度。此外,我们提出了一种信息不对称的样本对构建方法结合一致性学习,以解决硬样本挖掘问题,增强模型的鲁棒性。实验结果表明,所提方法显著提升了跨模态匹配准确率,为文本到人物图像匹配提供了一种高效且实用的解决方案。
引用
@article{arxiv.2507.06744,
title = {Dual-Granularity Cross-Modal Identity Association for Weakly-Supervised Text-to-Person Image Matching},
author = {Yafei Zhang and Yongle Shang and Huafeng Li},
journal= {arXiv preprint arXiv:2507.06744},
year = {2025}
}