面向LSVOS挑战RVOS轨迹的实例中心Transformer:第三名解答
计算机视觉与模式识别
2024-08-21 v1
摘要
指涉式视频对象分割是一种新兴的多模态任务,旨在给定自然语言表达对视频中的对象进行分割。本文构建了两个实例中心模型,并融合帧级和实例级的预测结果。首先,我们将实例掩码引入 DETR-based 模型中用于查询初始化,以实现时间增强,并采用 SAM 进行空间细化。其次,我们构建一个实例检索模型,用于判断实例是否被指涉。最后,我们融合预测结果,方法在验证阶段获得 52.67 的 J&F 分数,在测试阶段获得 60.36 的 J&F 分数,最终在第 6 届 LSVOS 挑战 RVOS 轨迹中获得第三名成绩。
引用
@article{arxiv.2408.10541,
title = {The Instance-centric Transformer for the RVOS Track of LSVOS Challenge: 3rd Place Solution},
author = {Bin Cao and Yisi Zhang and Hanyi Wang and Xingjian He and Jing Liu},
journal= {arXiv preprint arXiv:2408.10541},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2406.13939