中文

面向LSVOS挑战RVOS轨迹的实例中心Transformer:第三名解答

计算机视觉与模式识别 2024-08-21 v1

摘要

指涉式视频对象分割是一种新兴的多模态任务,旨在给定自然语言表达对视频中的对象进行分割。本文构建了两个实例中心模型,并融合帧级和实例级的预测结果。首先,我们将实例掩码引入 DETR-based 模型中用于查询初始化,以实现时间增强,并采用 SAM 进行空间细化。其次,我们构建一个实例检索模型,用于判断实例是否被指涉。最后,我们融合预测结果,方法在验证阶段获得 52.67 的 J&F 分数,在测试阶段获得 60.36 的 J&F 分数,最终在第 6 届 LSVOS 挑战 RVOS 轨迹中获得第三名成绩。

关键词

引用

@article{arxiv.2408.10541,
  title  = {The Instance-centric Transformer for the RVOS Track of LSVOS Challenge: 3rd Place Solution},
  author = {Bin Cao and Yisi Zhang and Hanyi Wang and Xingjian He and Jing Liu},
  journal= {arXiv preprint arXiv:2408.10541},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2406.13939