C2F-TCN:一种用于半监督与全监督时间动作分割的框架
计算机视觉与模式识别
2022-12-22 v1
摘要
时间动作分割为输入中包含按序列排列多个动作的无裁剪视频的每一帧标注动作标签。针对时间动作分割任务,我们提出一种编码器-解码器风格架构 C2F-TCN,其特点是对解码器输出进行“由粗到细”的集成。C2F-TCN 框架通过一种新颖的模型无关时间特征增强策略得到加强,该策略由计算代价低廉的段随机最大池化策略构成。它在三个基准动作分割数据集上产生更准确且校准良好的监督结果。我们展示该架构对监督与表示学习均具灵活性。据此,我们提出一种从 C2F-TCN 学习逐帧表示的新无监督方法。我们的无监督学习方法依赖于输入特征的聚类能力以及由解码器隐式结构形成的多分辨率特征。此外,我们通过将表示学习与传统监督学习合并,提供了首个半监督时间动作分割结果。我们的半监督学习方案称为“迭代-对比-分类(ICC)”,随标注数据增多而逐步提升性能。C2F-TCN 中的 ICC 半监督学习在 40% 标注视频下表现与全监督对应方法相近。
引用
@article{arxiv.2212.11078,
title = {C2F-TCN: A Framework for Semi and Fully Supervised Temporal Action Segmentation},
author = {Dipika Singhania and Rahul Rahaman and Angela Yao},
journal= {arXiv preprint arXiv:2212.11078},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2112.01402