中文

面向视觉定位的短语解耦跨模态层次匹配与渐进位置校正

计算机视觉与模式识别 2024-11-01 v1

摘要

视觉定位因其在各种视觉语言任务中的广泛应用而备受关注。尽管视觉定位已取得显著研究进展,但现有方法忽略了不同层次上文本与图像特征之间的关联对跨模态匹配的促进作用。本文提出了一种短语解耦跨模态层次匹配与渐进位置校正的视觉定位方法。该方法首先通过解耦的句子短语生成掩码,并构建了文本与图像的层次匹配机制,突出了不同层次间关联在跨模态匹配中的作用。此外,基于该层次匹配机制,定义了一种相应的目标对象位置渐进校正策略,以实现对文本描述目标对象的精确定位。该方法能够随着文本对目标对象描述确定性的提高,持续优化和调整目标对象的边界框位置。此设计探索了不同层次特征间的关联,并突出了与目标对象及其位置相关的特征在目标定位中的作用。通过在多个数据集上的实验验证了所提方法,并通过与最先进方法的性能对比验证了其优越性。

关键词

引用

@article{arxiv.2410.23570,
  title  = {Phrase Decoupling Cross-Modal Hierarchical Matching and Progressive Position Correction for Visual Grounding},
  author = {Minghong Xie and Mengzhao Wang and Huafeng Li and Yafei Zhang and Dapeng Tao and Zhengtao Yu},
  journal= {arXiv preprint arXiv:2410.23570},
  year   = {2024}
}

备注

This work has been accepted by TMM