学习更好地学习以改进视频目标分割
计算机视觉与模式识别
2022-12-06 v1
摘要
近来,联合学习框架(JOINT)集成了基于匹配的转导推理与在线归纳学习,以实现准确且鲁棒的半监督视频目标分割(SVOS)。然而,使用掩码嵌入作为标签来引导两分支中目标特征的生成可能导致目标表征不充分并降低性能。此外,如何合理地融合两不同分支中的目标特征,而非简单相加以避免某一主导分支的负面影响,尚待研究。本文中,我们提出一种新框架,强调为 SVOS 学习更好地学习(LLB)目标特征,称为 LLB,其中我们设计了判别性标签生成模块(DLGM)与自适应融合模块以解决这些问题。具体而言,DLGM 以背景滤波帧而非目标掩码作为输入,并采用轻量编码器生成目标特征,其作为在线少样本学习器的标签及 transformer 中解码器的值,以引导两分支学习更具判别性的目标表征。自适应融合模块为每个分支维护一个可学习门控,其对逐元素特征表征重新加权,并允许各分支中自适应量的目标信息流入融合目标特征,从而防止某一分支主导并使目标特征对干扰物更鲁棒。在公开基准上的大量实验表明,我们提出的 LLB 方法取得了最先进的性能。
引用
@article{arxiv.2212.02112,
title = {Learning to Learn Better for Video Object Segmentation},
author = {Meng Lan and Jing Zhang and Lefei Zhang and Dacheng Tao},
journal= {arXiv preprint arXiv:2212.02112},
year = {2022}
}