LoSh:用于指代视频目标分割的长短文本联合预测网络
计算机视觉与模式识别
2024-04-03 v3
摘要
指代视频目标分割(RVOS)旨在分割视频片段中由给定文本表达式所指的目标实例。文本表达式通常包含对实例外观、动作及与其他实例关系的复杂描述。因此,RVOS模型很难在视频中对应地捕捉所有这些属性;事实上,模型往往更偏向实例与动作和关系相关的视觉属性。这可能导致对目标实例的部分甚至错误的掩码预测。我们通过从原始长文本表达式中提取以主体为中心的短文本表达式来解决此问题。短文本仅保留目标实例与外观相关的信息,从而可将其用于引导模型关注实例的外观。我们让模型同时使用长短文本表达式进行联合预测,并插入长短交叉注意力模块以交互联合特征,以及长短预测交集损失以约束联合预测。除语言部分的改进外,我们还引入了前向-后向视觉一致性损失,利用光流在标注帧与其时间邻帧之间扭曲视觉特征以保持一致性。我们的方法构建于两个最先进(SOTA)流水线之上。在A2D-Sentences、Refer-YouTube-VOS、JHMDB-Sentences和Refer-DAVIS17上的大量实验显示了我们方法的显著提升。代码见 https://github.com/LinfengYuan1997/Losh。
引用
@article{arxiv.2306.08736,
title = {LoSh: Long-Short Text Joint Prediction Network for Referring Video Object Segmentation},
author = {Linfeng Yuan and Miaojing Shi and Zijie Yue and Qijun Chen},
journal= {arXiv preprint arXiv:2306.08736},
year = {2024}
}
备注
CVPR2024