LiquidTAD:基于并行类液体 relaxation 的高效时序动作检测
计算机视觉与模式识别
2026-04-28 v2
摘要
时序动作检测(TAD)要求在长未剪辑视频序列中精确定位动作边界。虽然当前高性能方法在准确率方面表现优异,但往往具有参数数量过多、计算开销大以及依赖专用算子,限制其在多样化硬件平台上的部署。本文提出LiquidTAD,一个通过并行类液体 relaxation 机制实现高效时序动作检测的框架,将液体神经动力学的指数 relaxation prior 提炼为并行时序算子,而非完整复现液体神经网络(LNN)动力学。通过引入并行类液体 relaxation 机制,避免顺序ODE求解,构建完全向量化、非递归形式,全部基于标准神经操作,实现硬件无关部署,时间复杂度随时序长度线性增长。此外,层次性衰减率共享策略进一步在特征金字塔层级间适配该 relaxation prior,稳定优化过程,隐式补偿深层特征压缩。在THUMOS-14和ActivityNet-1.3上的实验评估表明,LiquidTAD在准确率上与强基线相当,同时显著降低模型规模。具体而言,在THUMOS-14上,LiquidTAD实现69.46%的平均mAP,仅需10.82M参数和27.17G FLOPs,参数数量比ActionFormer降低超过60%。
引用
@article{arxiv.2604.18274,
title = {LiquidTAD: Efficient Temporal Action Detection via Parallel Liquid-Inspired Temporal Relaxation},
author = {Zepeng Sun and Naichuan Zheng and Hailun Xia and Junjie Wu and Liwei Bao and Xiaotai Zhang},
journal= {arXiv preprint arXiv:2604.18274},
year = {2026}
}