增强时序动作定位:基于递归机制的高级 S6 模型
计算机与社会
2024-07-19 v1
摘要
时序动作定位(TAL)是视频分析中的关键任务,旨在识别动作的精确开始和结束时间。现有方法如 CNN、RNN、GCN 和 Transformer 在捕捉长程依赖关系和时序因果性方面存在局限。为此,我们提出一种新颖的 TAL 架构,利用选择性状态空间模型(S6)。我们的方法集成了特征聚合双 S6 块、双向双 S6 结构以及一种递归机制,以在不增加参数复杂度的前提下增强时序和通道间依赖关系的建模。广泛的基准数据集实验表明,我们的方法在 THUMOS-14 上获得 74.2% 的 mAP,在 ActivityNet 上获得 42.9% 的 mAP,在 FineAction 上获得 29.6% 的 mAP,在 HACS 上获得 45.8% 的 mAP。消融研究验证了我们方法的有效性,表明 Stem 模块中的双结构和递归机制均优于传统方法。我们的发现表明 S6 基于模型在 TAL 任务中具有潜力,为未来研究指明了方向。
引用
@article{arxiv.2407.13077,
title = {Visions of a Discipline: Analyzing Introductory AI Courses on YouTube},
author = {Severin Engelmann and Madiha Zahrah Choksi and Angelina Wang and Casey Fiesler},
journal= {arXiv preprint arXiv:2407.13077},
year = {2024}
}