深度交互式区域分割与描述
计算机视觉与模式识别
2017-07-27 v1
摘要
随着稠密图像描述的最新创新,现在可以在用边界框确定物体的同时,用描述语描述场景中的每个物体。然而,由于存在许多重叠的边界框,此类输出的解释并非易事。此外,在当前的描述框架中,用户无法引入个人偏好以排除不感兴趣的区域。在本文中,我们提出了一种用于交互式区域分割与描述的新型混合深度学习架构,用户可以指定图像中需要处理的任意区域。为此,使用我们特殊的训练数据训练了一个名为 Lyncean FCN (LFCN) 的专用全卷积网络,以将用户意图区域作为高效分割的输出进行隔离。同时,利用稠密图像描述模型为该区域提供多种描述语。然后,使用最佳匹配边界框的描述语来解释 UIR。据我们所知,这是首个提供此类全面输出的工作。我们的实验表明,在多个知名数据集上,所提出的方法优于最先进的交互式分割方法。此外,用交互式分割结果替换边界框,不仅有助于更好地理解稠密图像描述输出,还提升了目标检测在交并比方面的准确率。
引用
@article{arxiv.1707.08364,
title = {Deep Interactive Region Segmentation and Captioning},
author = {Ali Sharifi Boroujerdi and Maryam Khanian and Michael Breuss},
journal= {arXiv preprint arXiv:1707.08364},
year = {2017}
}
备注
17, pages, 9 figures