中文

ActFusion:用于动作分割与预期的统一扩散模型

计算机视觉与模式识别 2024-12-06 v1 机器学习

摘要

时序动作分割和长期动作预期是视频时序分析中两类流行视觉任务。尽管二者看似相关且潜在互补,但往往被视为独立问题来研究。本文提出一种统一的扩散模型ActFusion,将动作分割与动作预期联合解决。其核心思想是训练模型能有效处理序列中可见与不可见部分:可见部分用于时序分割,可见部分用于未来预期。为此,我们引入一种新的anticipative masking策略,在训练时将视频帧的后期部分遮蔽为不可见,用可学习的token替换这些帧,以学习预测不可见未来。实验结果表明,动作分割与预期之间存在双向益处。ActFusion 在50个标准基准数据集(包括 Salads、Breakfast 和 GTEA)上实现了状态的最佳性能,凭借联合学习,单一模型在两个任务上均超越了任务特定模型。

关键词

引用

@article{arxiv.2412.04353,
  title  = {ActFusion: a Unified Diffusion Model for Action Segmentation and Anticipation},
  author = {Dayoung Gong and Suha Kwak and Minsu Cho},
  journal= {arXiv preprint arXiv:2412.04353},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024