中文

文本-空中人员检索的跨模糊对齐网络及大规模基准

计算机视觉与模式识别 2026-03-24 v1

摘要

文本-空中人员检索旨在从无人机捕获的图像中识别眼证描述中的目标,支持智能交通和公共安全应用。与地面视角文本-图像人员检索相比,无人机捕获的图像常因视角剧烈变化和飞行高度差异导致视觉信息受损,使与文本描述的语义对齐极具挑战性。为此,我们提出一种新型跨模糊对齐网络,通过模糊逻辑对 token 级别可靠性进行量化,以实现精确的细粒度对齐,并将地面视角图像作为桥接代理进一步缓解空中图像与文本描述之间的差距,用于文本-空中人员检索。具体而言,我们设计了模糊 Token 对齐模块,采用模糊成员函数动态建模 token 级别关联强度,抑制不可见或噪声 token 的影响。它可以缓解因视觉线索缺失而导致的语义不一致,显著提升 token 级别语义对齐的鲁棒性。此外,为进一步缓解空中图像与文本描述之间的差距,我们设计了上下文感知动态对齐模块,将地面视角代理作为桥接 agent 融入文本-空中对齐中,自适应组合直接对齐与代理辅助对齐,以提升鲁棒性。此外,我们构建了一个大规模基准数据集,称为 AERI-PEDES,采用链式思维方法将文本生成分解为属性解析、初始描述生成和细化,从而提升文本准确性和语义一致性。在 AERI-PEDES 和 TBAPR 上的实验表明,我们的方法具有优越性。

关键词

引用

@article{arxiv.2603.20721,
  title  = {Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark},
  author = {Yifei Deng and Chenglong Li and Yuyang Zhang and Guyue Hu and Jin Tang},
  journal= {arXiv preprint arXiv:2603.20721},
  year   = {2026}
}

备注

Accepted by CVPR 2026 main track