中文

面向少样本的指代视频对象分割跨模态亲和学习

计算机视觉与模式识别 2023-09-06 v1

摘要

指代视频对象分割(RVOS)作为一种监督学习任务,依赖于给定场景的充分标注数据。然而,在更现实的场景中,新场景仅有极少量标注可用,这对现有 RVOS 方法提出了重大挑战。鉴于此,我们提出了一种简单而有效的模型,其基于 Transformer 架构新设计了跨模态亲和(CMA)模块。CMA 模块利用少量样本构建多模态亲和,从而快速学习新的语义信息,并使模型能够适应不同场景。由于我们提出的方法针对新场景的少样本,我们将该问题泛化为——少样本指代视频对象分割(FS-RVOS)。为推动该方向的研究,我们基于现有数据集构建了一个新的 FS-RVOS 基准。该基准覆盖广泛范围并包含多种情形,可最大程度模拟真实世界场景。大量实验表明,我们的模型仅用少量样本即可良好适应不同场景,在基准上达到最先进的性能。在 Mini-Ref-YouTube-VOS 上,我们的模型取得 53.1 J 和 54.8 F 的平均性能,比基线高出 10%。此外,我们在 Mini-Ref-SAIL-VOS 上取得了 77.7 J 和 74.8 F 的出色结果,显著优于基线。代码已公开于 https://github.com/hengliusky/Few_shot_RVOS。

关键词

引用

@article{arxiv.2309.02041,
  title  = {Learning Cross-Modal Affinity for Referring Video Object Segmentation Targeting Limited Samples},
  author = {Guanghui Li and Mingqi Gao and Heng Liu and Xiantong Zhen and Feng Zheng},
  journal= {arXiv preprint arXiv:2309.02041},
  year   = {2023}
}

备注

Accepted by ICCV2023