基于无监督帧到段对齐的排列感知动作分割
计算机视觉与模式识别
2025-12-03 v5
摘要
本文提出一种基于 transformer 的无监督时间活动分割框架,其不仅利用帧级线索,还利用段级线索。这与以往通常仅依赖帧级信息的方法形成对比。我们的方法始于一个帧级预测模块,该模块通过 transformer 编码器估计逐帧动作类别。帧级预测模块通过时间最优传输以无监督方式训练。为利用段级信息,我们采用一个段级预测模块和一个帧到段对齐模块。前者包含一个用于估计视频转录的 transformer 解码器,而后者将帧级特征与段级特征进行匹配,产生排列感知的分割结果。此外,受时间最优传输启发,我们为上述模块的无监督训练引入了简单而有效的伪标签。我们在四个公开数据集(即 50 Salads、YouTube Instructions、Breakfast 和 Desktop Assembly)上的实验表明,我们的方法在无监督活动分割中取得了与以往方法相当或更好的性能。我们的代码和数据集可在研究网站获取:https://retrocausal.ai/research/。
引用
@article{arxiv.2305.19478,
title = {Permutation-Aware Action Segmentation via Unsupervised Frame-to-Segment Alignment},
author = {Quoc-Huy Tran and Ahmed Mehmood and Muhammad Ahmed and Muhammad Naufil and Anas Zafar and Andrey Konin and M. Zeeshan Zia},
journal= {arXiv preprint arXiv:2305.19478},
year = {2025}
}
备注
Accepted to WACV 2024