TokenMotion:基于可学习令牌选择的运动引导视觉Transformer用于视频伪装目标检测
计算机视觉与模式识别
2024-02-05 v2
摘要
视频伪装目标检测(VCOD)领域由于目标物体与其周围环境之间的纹理相似性,以及由物体和相机运动共同引起的不规则运动模式,在计算机视觉中提出了独特挑战。在本文中,我们介绍了TokenMotion(TMNet),其采用基于transformer的模型,通过利用可学习令牌选择提取运动引导特征来增强VCOD。在具有挑战性的MoCA-Mask数据集上评估,TMNet在VCOD中取得了最先进的性能。它相对于现有最先进方法在加权F度量上提升了12.8%,在S度量上增强了8.4%,在平均IoU上提高了10.7%。结果展示了在基于transformer的框架内利用通过可学习令牌选择的运动引导特征来处理VCOD这一复杂任务的优势。
引用
@article{arxiv.2311.02535,
title = {TokenMotion: Motion-Guided Vision Transformer for Video Camouflaged Object Detection Via Learnable Token Selection},
author = {Zifan Yu and Erfan Bank Tavakoli and Meida Chen and Suya You and Raghuveer Rao and Sanjeev Agarwal and Fengbo Ren},
journal= {arXiv preprint arXiv:2311.02535},
year = {2024}
}
备注
Revising Needed