面向紧凑视频离散化的语义感知时空标记器 SweetTok
计算机视觉与模式识别
2025-03-12 v3 人工智能
摘要
本文提出了一种名为 \textbf{S}emantic-a\textbf{W}ar\textbf{E} \textbf{T}okenizer(SweetTok)的新型视频标记器,以克服当前视频标记方法在紧凑性和有效性之间的局限。不同于处理展平后的局部视觉块通过直接离散化或自适应查询标记化的先前方法,SweetTok 提出了一种解耦框架,通过 \textbf{D}ecoupled \textbf{Q}uery \textbf{A}uto\textbf{E}ncoder(DQAE)对视觉输入进行不同的空间和时间查询压缩。这种设计使 SweetTok 能够在捕捉空间和时间维度中关键信息方面实现卓越保真度,同时高效压缩视频标记数量。此外,我们设计了 \textbf{M}otion-enhanced \textbf{L}anguage \textbf{C}odebook(MLC),专为空间和时间压缩量身定制,以解决外观信息和运动信息在语义表示方面的差异。SweetTok 通过 \textbf{42.8\%} 的 rFVD 提升视频重建效果,并通过 \textbf{15.1\%} 的 gFVD 增强下游视频生成结果。此外,压缩后的解耦标记被赋予语义信息,使其能够受益于大语言模型(LLM)在下游应用中的少样本识别能力。
引用
@article{arxiv.2412.10443,
title = {SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization},
author = {Zhentao Tan and Ben Xue and Jian Jia and Junhao Wang and Wencai Ye and Shaoyun Shi and Mingjie Sun and Wenjin Wu and Quan Chen and Peng Jiang},
journal= {arXiv preprint arXiv:2412.10443},
year = {2025}
}