Temporal2Seq:用于时序视频理解任务的统一框架
计算机视觉与模式识别
2024-09-30 v1
摘要
随着视频理解的发展,针对片段级时序视频分析的任务激增,包括时序动作检测 (TAD)、时序动作分割 (TAS) 和通用事件边界检测 (GEBD)。虽然特定于任务的视频理解模型在每个任务中都表现出色,但仍然缺乏能够同时处理多个任务的统一框架,这是下一代 AI 的一个有前景的方向。为此,在本文中,我们提出了一个单一的统一框架,称为 Temporal2Seq,将这些时序视频理解任务的输出形式化为离散 token 序列。通过这种统一的 token 表示,Temporal2Seq 可以在单一架构内针对不同的视频理解任务训练一个通用模型。在缺乏多任务学习 (MTL) 基准的情况下,我们通过借用 TAD、TAS 和 GEBD 任务的数据集编制了一个全面的协同训练数据集。我们在三个任务的相应测试集上评估了我们的 Temporal2Seq 通用模型,证明 Temporal2Seq 可以在各种任务上产生合理的结果,并且与该框架上的单任务训练相比具有优势。我们还研究了我们的通用模型在不同任务的新数据集上的泛化性能,其表现优于特定模型。
引用
@article{arxiv.2409.18478,
title = {Temporal2Seq: A Unified Framework for Temporal Video Understanding Tasks},
author = {Min Yang and Zichen Zhang and Limin Wang},
journal= {arXiv preprint arXiv:2409.18478},
year = {2024}
}