中文

记忆、评分与参考:捕捉视频中的隐蔽目标

计算机视觉与模式识别 2025-03-24 v1

摘要

视频隐蔽目标检测(VCOD)旨在分割外观与环境高度相似的目标,属于具有挑战性和新兴的任务。现有视觉模型在面对此类场景时常因隐蔽目标的难以区分外观以及未充分利用视频动态信息而受限。为此,我们提出一种受人类记忆-识别启发的端到端VCOD框架,集成历史视频信息的参考帧,以实现隐蔽序列处理。具体设计双urpose解码器,同时生成预测掩码和评分得分,基于评分进行参考帧选择,并引入辅助监督以增强特征提取。进一步,本研究提出一种新颖的参考导引的多级非对称注意力机制,有效整合长期参考信息与短期运动线索,实现全面特征提取。通过组合这些模块,我们构建Scoring、Remember、Reference(SRR)框架,高效提取信息定位目标,并利用记忆引导提升后续处理。凭借优化的模块设计和有效利用视频数据的特性,本模型在基准数据集上显著超越现有方法,提升10%性能,仅需5400万参数,单次遍历视频即可完成推理。代码将公开释放。

引用

@article{arxiv.2503.17050,
  title  = {Scoring, Remember, and Reference: Catching Camouflaged Objects in Videos},
  author = {Yuang Feng and Shuyong Gao and Fuzhen Yan and Yicheng Song and Lingyi Hong and Junjie Hu and Wenqiang Zhang},
  journal= {arXiv preprint arXiv:2503.17050},
  year   = {2025}
}