中文

基于区域掩码的参与者—动作语义分割

计算机视觉与模式识别 2018-07-24 v1 人工智能 多媒体

摘要

本文研究参与者—动作语义分割问题,该问题需要对视频帧中的参与者类别与动作类别进行联合标注。该任务的一个主要挑战是,当参与者执行动作时,参与者的不同身体部位为动作类别提供不同类型的线索,且在独立标注时可能接收到不一致的动作标签。为解决此问题,我们提出了一种基于区域的端到端参与者—动作分割方法,其依赖于实例分割算法产生的区域掩码。我们的主要创新在于避免独立标注区域掩码内的像素——而是为这些像素分配单一动作标签以实现一致的动作标注。当一个像素属于多个区域掩码时,采用最大池化解决标注冲突。我们的方法使用双流网络作为前端(学习捕捉外观与运动信息的特征),并使用两个基于区域的分割网络作为后端(以双流网络融合的特征作为输入并预测参与者—动作标注)。在 A2D 数据集上的实验表明,基于区域的分割策略与双流网络的融合特征均有助于性能提升。所提方法在平均类别准确率上超越最先进结果逾 8%,在平均类别交并比(IOU)上超越逾 5%,验证了其有效性。

关键词

引用

@article{arxiv.1807.08430,
  title  = {Actor-Action Semantic Segmentation with Region Masks},
  author = {Kang Dang and Chunluan Zhou and Zhigang Tu and Michael Hoy and Justin Dauwels and Junsong Yuan},
  journal= {arXiv preprint arXiv:1807.08430},
  year   = {2018}
}

备注

Accepted by BMVC 2018