基于时间尺度的状态空间模型用于密集视频描述
计算机视觉与模式识别
2025-09-04 v1
摘要
密集视频描述是一种具有挑战性的视频理解任务,旨在同时将视频分割为一序列有意义的连续事件,并生成详细的描述以准确描述每个事件。现有方法往往在处理与密集视频描述相关的长视频时遇到困难,由于计算复杂度和内存限制此问题尤为突出。此外,传统方法需要将整个视频作为输入才能产生答案,这排除了对视频的在线处理。我们通过时间尺度将状态空间模型(SSM)扩展到更长的序列。我们的方法,State-Space Models with Transfer State,结合了 SSM 的长序列和循环属性,解决了 SSM 无法在非常长的上下文中维持其状态的主要限制,有效地将 SSM 在时间上的扩展进一步推进。该模型特别适合以在线或流式方式生成描述,无需等待整个视频处理完成,这在实际中更为有益。应用于密集视频描述时,我们的方法能够很好地处理视频长度,并使用 7 倍更少的 FLOPs。
引用
@article{arxiv.2509.03426,
title = {Time-Scaling State-Space Models for Dense Video Captioning},
author = {AJ Piergiovanni and Ganesh Satish Mallya and Dahun Kim and Anelia Angelova},
journal= {arXiv preprint arXiv:2509.03426},
year = {2025}
}
备注
BMVC 2025