由粗到细的多分辨率时间卷积网络
计算机视觉与模式识别
2021-05-25 v1
摘要
时间卷积网络(TCNs)是时序视频分割中常用的架构。然而,TCNs往往存在过分割错误,并需要额外的细化模块以保证平滑性与时间连贯性。在本工作中,我们提出一种新颖的时间编码器-解码器来解决序列碎片化问题。具体而言,解码器遵循由粗到细的结构,隐式集成了多种时间分辨率。该集成产生了更平滑、更准确且校准更好的分割结果,从而绕过了对额外细化模块的需求。此外,我们通过多分辨率特征增强策略来强化训练,以提升对不同时序分辨率的鲁棒性。最后,为支持我们的架构并进一步促进序列连贯性,我们提出了一种在视频层级惩罚误分类的动作损失(action loss)。实验表明,我们的独立架构,结合我们新颖的特征增强策略与新的损失,在三个时序视频分割基准上优于当前最优(state-of-the-art)方法。
引用
@article{arxiv.2105.10859,
title = {Coarse to Fine Multi-Resolution Temporal Convolutional Network},
author = {Dipika Singhania and Rahul Rahaman and Angela Yao},
journal= {arXiv preprint arXiv:2105.10859},
year = {2021}
}