中文

面向文本到图像人物检索的注意力加权选择性掩码与噪声标签抑制

计算机视觉与模式识别 2025-02-11 v3

摘要

大多数现有的文本到图像人物检索方法通常假设训练图像文本对完全对齐;然而,由于图像质量较差和标注错误,存在噪声对应关系(NC)问题(即不正确或不可靠的对齐)。此外,随机遮盖数据增强可能无意中丢弃关键语义内容,导致图像和文本描述之间出现噪声匹配。为解决上述两个问题,我们提出了一种噪声标签抑制方法以缓解 NC 问题,以及一种注意力加权选择性掩码(AWM)策略以解决随机遮盖造成的问题。具体而言,双向相似度分布匹配(BSDM)损失使模型能够有效地从正面配对中学习,同时防止其过度依赖这些配对,从而缓解对噪声标签的风险。配合这一点,权重调整焦点(WAF)损失提高了模型处理困难样本的能力。此外,AWM 通过处理 EMA 版本的图像编码器,选择性地保留与文本具有强语义连接的标记,实现更好的特征提取。大量实验表明,我们的方法在解决与噪声相关的问题以及提高检索性能方面均具有有效性。

关键词

引用

@article{arxiv.2409.06385,
  title  = {AMNS: Attention-Weighted Selective Mask and Noise Label Suppression for Text-to-Image Person Retrieval},
  author = {Runqing Zhang and Xue Zhou},
  journal= {arXiv preprint arXiv:2409.06385},
  year   = {2025}
}