Resi-VidTok:面向超低速率和轻量化视频传输的高效分解式渐进分词框架
信息论
2025-10-30 v1 计算机视觉与模式识别
多媒体
图像与视频处理
math.IT
摘要
实时传输视频至无线网络仍高度具挑战性,尤其在带宽受限、连接不稳的恶劣信道条件下。本文提出 Resi-VidTok,一种面向超低速率和轻量化视频传输的韧性分词启用框架,旨在提供强鲁棒性,同时保持感知和语义保真度于普通数字硬件。通过将时空内容重新组织为由关键分词和细化分词组成的离散、按重要性排序的分词流,Resi-VidTok 实现渐进式编码、前缀可解复原和在受限信道下的优雅质量衰减。关键贡献是为视频实现韧性 1D 分词管线,集成差分时序分词编码,显式支持从不完整分词集合中单一共享帧级解码器恢复——无需辅助时序提取器或重型生成模型。此外,结合受控稀疏化和轻量解码器端插值,减少传输负载,同时保持运动连续性。最后,一个信道自适应源-信道编码与调制方案根据分词重要性和信道条件动态分配速率与保护,实现在恶劣信噪比下的稳定质量。评估结果表明,在信道带宽比(CBR)降至 0.0004 时,Resi-VidTok 仍能实现稳健的视觉与语义一致性,解码速度超过 30 fps,展示了其在节能、低时延和可靠性关键场景中的实用性。
引用
@article{arxiv.2510.25002,
title = {Resi-VidTok: An Efficient and Decomposed Progressive Tokenization Framework for Ultra-Low-Rate and Lightweight Video Transmission},
author = {Zhenyu Liu and Yi Ma and Rahim Tafazolli and Zhi Ding},
journal= {arXiv preprint arXiv:2510.25002},
year = {2025}
}