扩散动作分割
计算机视觉与模式识别
2023-08-15 v2 图像与视频处理
摘要
时间动作分割对于理解长视频至关重要。此前该任务的工作通常采用多阶段模型的迭代细化范式。我们提出了一种基于去噪扩散模型的新框架,其同样具有此类迭代细化的内在精神。在该框架中,动作预测以输入视频特征为条件,从随机噪声中迭代生成。为增强对人类动作三个显著特性(包括位置先验、边界模糊性和关系依赖性)的建模,我们为该框架中的条件输入设计了一种统一的掩码策略。在三个基准数据集(即 GTEA、50Salads 和 Breakfast)上进行了大量实验,所提方法取得了优于或可与最先进方法相媲美的结果,展示了生成式方法用于动作分割的有效性。
引用
@article{arxiv.2303.17959,
title = {Diffusion Action Segmentation},
author = {Daochang Liu and Qiyue Li and AnhDung Dinh and Tingting Jiang and Mubarak Shah and Chang Xu},
journal= {arXiv preprint arXiv:2303.17959},
year = {2023}
}
备注
ICCV 2023