TBT-Former:用于动作局部化学习时序边界分布
摘要
时序动作局部化 (Temporal Action Localization, TAL) 仍是视频理解中的基础挑战,旨在识别 untrimmed 视频中所有动作实例的起始时间、结束时间和类别。虽然近期单阶段、无锚点模型如 ActionFormer 通过 Transformer 进行时序推理已取得高水平成绩,但常面临两个持续存在的难题:对边界模糊或“fuzzy”时序边界动作的精确局部化,以及有效融合多尺度上下文信息。本文引入 Temporal Boundary Transformer (TBT-Former),一种新型架构直接解决上述局限。TBT-Former 在强大的 ActionFormer 基础上增加三项核心贡献:(1) 高容量 scaled Transformer 主干网络,增加注意力头数量并扩大多层感知器 (MLP) 维度,以实现更强大的时序特征提取;(2) 跨尺度特征金字塔网络 (FPN),集成自上而下路径与侧向连接,实现高级语义与低级时序细节的更丰富融合;(3) 新型边界分布回归头。该新头灵感来源于 Generalized Focal Loss (GFL) 原理,将具有挑战性的边界回归任务转化为更灵活的概率分布学习问题,使模型能够显式表示和推理边界不确定性。在 Transformer 架构范式下,TBT-Former 在前任模型设立的高水平基准上实现了新的表现水平,在高度竞争的 THUMOS14 和 EPIC-Kitchens 100 数据集上取得优异成绩,在大规模 ActivityNet-1.3 数据集上同样表现竞争力。我们的代码已公开于 https://github.com/aaivu/In21-S7-CS4681-AML-Research-Projects/tree/main/projects/210536K-Multi-Modal-Learning_Video-Understanding。
关键词
引用
@article{arxiv.2512.01298,
title = {TBT-Former: Learning Temporal Boundary Distributions for Action Localization},
author = {Thisara Rathnayaka and Uthayasanker Thayasivam},
journal= {arXiv preprint arXiv:2512.01298},
year = {2025}
}
备注
8 pages, 6 figures