基于序列到序列翻译的统一全监督与时间戳监督时间动作分割
计算机视觉与模式识别
2022-10-12 v2
摘要
本文介绍了一种通过序列到序列(seq2seq)翻译在全监督和时间戳监督设置下实现视频动作分割的统一框架。与当前最先进的帧级预测方法不同,我们将动作分割视为 seq2seq 翻译任务,即把视频帧序列映射为动作段序列。我们提出的方法对标准 Transformer seq2seq 翻译模型进行了一系列修改并引入辅助损失函数,以应对长输入序列、短输出序列以及视频数量相对较少的情况。我们通过帧级损失为编码器引入辅助监督信号,并提出一个独立的对齐解码器用于隐式时长预测。最后,我们通过提出的约束 k-medoids 算法生成伪分割,将框架扩展至时间戳监督设置。我们提出的框架在全监督和时间戳监督设置上均表现稳定,在多个数据集上优于或媲美最先进方法。我们的代码公开于 https://github.com/boschresearch/UVAST。
引用
@article{arxiv.2209.00638,
title = {Unified Fully and Timestamp Supervised Temporal Action Segmentation via Sequence to Sequence Translation},
author = {Nadine Behrmann and S. Alireza Golestaneh and Zico Kolter and Juergen Gall and Mehdi Noroozi},
journal= {arXiv preprint arXiv:2209.00638},
year = {2022}
}
备注
ECCV 2022 (Main Conference)