端到端动作分割 Transformer
计算机视觉与模式识别
2025-08-28 v3 图像与视频处理
摘要
最近关于动作分割的工作大多依赖于在其他任务上训练的模型所预计算的帧特征,并且通常侧重于逐帧编码和标记,而没有对动作片段进行显式建模。为了克服这些局限性,我们引入了端到端动作分割 Transformer(EAST),它直接处理原始视频帧——消除了对预提取特征的需求,并实现了真正的端到端训练。我们的贡献如下:(1)用于有效微调大型骨干网络的轻量级适配器设计;(2)一个高效的通过检测进行分割的框架,用于利用在粗下采样视频上预测的动作提案;(3)一种新颖的基于动作提案的数据增强策略。EAST 在包括 GTEA、50Salads、Breakfast 和 Assembly-101 在内的标准基准测试上取得了 SOTA 性能。
引用
@article{arxiv.2503.06316,
title = {End-to-End Action Segmentation Transformer},
author = {Tieqiao Wang and Sinisa Todorovic},
journal= {arXiv preprint arXiv:2503.06316},
year = {2025}
}