中文

基于张量分解边界损失、卷积镶嵌与上下文感知跳跃连接的高保真交互式视频分割

计算机视觉与模式识别 2020-11-24 v1 机器学习 图像与视频处理

摘要

我们提出了一种用于交互式视频分割任务的高保真深度学习算法(HyperSeg),该算法采用具有上下文感知跳跃连接的卷积网络,并结合压缩的超列图像特征与卷积镶嵌过程。为了保持高输出保真度,我们的模型关键性地以高分辨率处理并渲染所有图像特征,而不使用下采样或池化操作。我们主要通过两种手段在模型中高效地保持这种一致的高等级保真度:(1)我们使用基于统计原理的张量分解过程来调节超列特征的数量;(2)我们使用卷积镶嵌技术以其原始分辨率渲染这些特征。为改进像素级分割结果,我们引入了边界损失函数;为改善视频数据中的时间相干性,我们在模型中纳入了时间图像信息。通过实验,我们证明了我们的模型在使用高分辨率视频数据的交互式分割任务中相对于基线模型具有更高的准确性。我们还引入了一个基准视频分割数据集,即 VFX Segmentation Dataset,其包含超过 27,046 个高分辨率视频帧,包括绿幕和各种合成场景以及相应的人工标注像素级分割。我们的工作提出了对高分辨率数据下最先进分割保真度的改进扩展,并可广泛应用于包括 VFX 流水线和医学成像学科在内的众多应用领域。

关键词

引用

@article{arxiv.2011.11602,
  title  = {High Fidelity Interactive Video Segmentation Using Tensor Decomposition Boundary Loss Convolutional Tessellations and Context Aware Skip Connections},
  author = {Anthony D. Rhodes and Manan Goel},
  journal= {arXiv preprint arXiv:2011.11602},
  year   = {2020}
}