ViPT:视觉提示多模态跟踪
计算机视觉与模式识别
2023-03-28 v2
摘要
可见光模态目标跟踪衍生出一系列下游多模态跟踪分支。为继承基础模型的强大表征能力,多模态跟踪的一种自然做法是对基于 RGB 的参数进行全量微调。尽管有效,但由于下游数据稀缺和迁移性差等原因,这种方式并非最优。本文受近期提示学习在语言模型中成功的启发,提出视觉提示多模态跟踪(ViPT),其学习模态相关提示以将冻结的预训练基础模型适配到各种下游多模态跟踪任务。ViPT 找到了一种更好的方式来激发大规模预训练的基于 RGB 的模型的知识,同时仅引入极少可训练参数(少于模型参数的 1%)。ViPT 在包括 RGB+深度、RGB+热红外和 RGB+事件跟踪在内的多个下游跟踪任务上优于全量微调范式。大量实验展示了视觉提示学习在多模态跟踪中的潜力,且 ViPT 能在满足参数高效的同时取得最先进的性能。代码和模型见 https://github.com/jiawen-zhu/ViPT。
引用
@article{arxiv.2303.10826,
title = {Visual Prompt Multi-Modal Tracking},
author = {Jiawen Zhu and Simiao Lai and Xin Chen and Dong Wang and Huchuan Lu},
journal= {arXiv preprint arXiv:2303.10826},
year = {2023}
}
备注
Accepted by CVPR2023