TCMA:基于文本条件的无人机跨模态文本-视频检索中的多粒度对齐
计算机视觉与模式识别
2025-10-14 v1
摘要
无人机(UAV)已成为实时高分辨率数据收集的强大平台,产生大量航空视频。高效检索这些视频中的相关内容对于城市管理、应急响应、安保和灾害救援等应用至关重要。虽然文本-视频检索在自然视频领域取得了进展,但UAV领域仍鲜有探索,主要由于现有数据集存在粗糙和冗余标题的问题。为此,本工作构建了无人机视频-文本匹配数据集(DVTMD),包含2,864个视频和14,320个细粒度、语义多样的标题。这些注释捕捉了包括人类动作、物体、背景设置、环境条件和视觉风格等多个互补方面,从而增强文本-视频对应关系,减少冗余。基于该数据集,我们提出了文本条件多粒度对齐(TCMA)框架,集成全局视频-句子对齐、句子引导的帧聚合和单词引导的patch对齐。为进一步细化局部对齐,我们设计了一个单词和补丁选择模块,用于过滤无关内容,以及文本自适应动态温度机制,以适应文本类型的注意力锐度。广泛的实验在DVTMD和CapERA上进行,确立了无人机文本-视频检索的首个完整基准。我们的TCMA实现了最先进的性能,包括文本到视频的45.5% R@1和视频到文本的42.8% R@1,证明了我们数据集和方法的有效性。代码和数据集将发布。
引用
@article{arxiv.2510.10180,
title = {TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval},
author = {Zixu Zhao and Yang Zhan},
journal= {arXiv preprint arXiv:2510.10180},
year = {2025}
}