用于一致性点跟踪的自生语言嵌入
计算机视觉与模式识别
2024-07-31 v1
摘要
点跟踪是计算机视觉中一项具有挑战性的任务,旨在建立长视频序列中逐点的对应关系。近期的进展主要集中在时序建模技术上,以提升局部特征相似度,但往往忽略了跟踪点本身固有的宝贵语义一致性。本文提出了一种利用语言嵌入来增强与同一对象相关的逐帧视觉特征一致性的新方法。我们提出的方法称为用于视觉特征增强的自生语言嵌入,它增强了长序列中的点对应关系。与现有的视觉-语言方案不同,我们的方法通过一个专用的映射网络从视觉特征中学习文本嵌入,从而能够无缝适应各种跟踪任务,无需显式的文本标注。此外,我们引入了一个一致性解码器,能以最小的计算开销高效地将文本令牌整合到视觉特征中。通过增强视觉一致性,我们的方法显著改善了在具有显著外观变化的长视频中的跟踪轨迹。在广泛使用的跟踪基准上的大量实验证明了我们方法的优越性能,与仅依赖视觉线索的跟踪器相比,展现了显著的提升。
引用
@article{arxiv.2407.20730,
title = {Autogenic Language Embedding for Coherent Point Tracking},
author = {Zikai Song and Ying Tang and Run Luo and Lintao Ma and Junqing Yu and Yi-Ping Phoebe Chen and Wei Yang},
journal= {arXiv preprint arXiv:2407.20730},
year = {2024}
}
备注
accepted by ACM MM 2024