中文

基于强化学习的端到端流式视频时间动作分割

计算机视觉与模式识别 2024-05-24 v2

摘要

流式时间动作分割(STAS)任务是时间动作分割(TAS)的辅助任务,在视频理解领域尚未得到充分关注。现有的 TAS 方法由于严重依赖多模态特征和完整的上下文信息,局限于离线场景。STAS 任务要求模型按时间逐片段地对整个未裁剪视频序列的每一帧进行分类,从而将 TAS 方法的适用性扩展到在线场景。然而,直接将现有 TAS 方法应用于 STAS 任务会导致明显较差的分割结果。本文深入分析了 STAS 任务与 TAS 任务之间的根本差异,将模型迁移时的严重性能下降归因于模型偏差和优化困境。我们提出了一种基于强化学习的端到端流式视频时间动作分割模型(SVTAS-RL)。该端到端建模方法缓解了由任务性质变化引入的建模偏差,并增强了在线方案的可行性。利用强化学习来缓解优化困境。通过大量实验,SVTAS-RL 模型显著优于现有的 STAS 模型,并在相同评估标准下于多个数据集上取得了与最先进 TAS 模型相竞争的性能,在超长视频数据集 EGTEA 上展现出显著优势。代码见 https://github.com/Thinksky5124/SVTAS。

关键词

引用

@article{arxiv.2309.15683,
  title  = {End-to-End Streaming Video Temporal Action Segmentation with Reinforce Learning},
  author = {Jinrong Zhang and Wujun Wen and Shenglan Liu and Yunheng Li and Qifeng Li and Lin Feng},
  journal= {arXiv preprint arXiv:2309.15683},
  year   = {2024}
}

备注

submit to TNNLS