中文

Global2Local:面向视频动作分割的高效结构搜索

计算机视觉与模式识别 2021-05-03 v2

摘要

模型的时间感受野在动作分割中起着重要作用。大感受野有助于视频片段间的长期关系,而小感受野有助于捕捉局部细节。现有方法以手工设计的层内感受野构建模型。我们能否有效搜索感受野组合以替代手工设计模式?为回答此问题,我们提出通过由全局到局部的搜索方案寻找更优感受野组合。我们的搜索方案同时利用全局搜索寻找粗粒度组合,以及局部搜索进一步获得精炼的感受野组合模式。全局搜索发现除人工设计模式之外的可能粗粒度组合。在全局搜索基础上,我们提出一种期望引导的迭代局部搜索方案以有效精炼组合。我们的全局到局部搜索可插入现有动作分割方法中以取得最先进性能。

关键词

引用

@article{arxiv.2101.00910,
  title  = {Global2Local: Efficient Structure Search for Video Action Segmentation},
  author = {Shang-Hua Gao and Qi Han and Zhong-Yu Li and Pai Peng and Liang Wang and Ming-Ming Cheng},
  journal= {arXiv preprint arXiv:2101.00910},
  year   = {2021}
}

备注

Accepted by CVPR 2021. Source code: https://github.com/ShangHua-Gao/G2L-search