基于压缩与量化多条件标记的高级手语视频生成
计算机视觉与模式识别
2025-11-07 v2 人工智能
摘要
手语视频生成(SLVG)旨在从口语文本生成身份保持的手语视频。现有方法主要依赖单一粗糙条件(例如,骨架序列)作为桥接翻译模型和视频生成模型的中介,限制了生成视频的自然性和表达性。为克服这些限制,我们提出了 SignViP,一个新型 SLVG 框架,包含多个细粒度条件以提高生成保真度。SignViP 采用离散标记范式整合并表示细粒度条件(即细粒度姿态和 3D 手),而非直接翻译错误-prone 的高维条件。SignViP 包含三个核心组件。(1) Sign Video Diffusion Model 联合训练多条件编码器,以学习封装细粒度运动和外观的连续嵌入。(2) Finite Scalar Quantization(FSQ)自动编码器进一步训练,以压缩并量化这些嵌入为离散标记,以实现条件的紧凑表示。(3) Multi-Condition Token Translator 训练用于将口语文本翻译为离散多条件标记。在推理期间,Multi-Condition Token Translator 首先将口语文本翻译为离散多条件标记。这些标记随后由 FSQ 自动编码器解码为连续嵌入,然后注入 Sign Video Diffusion Model 以指导视频生成。实验结果表明,SignViP 在包括视频质量、时间一致性和语义忠实度在内的多个指标上实现了最佳性能。代码已公开于 https://github.com/umnooob/signvip/。
引用
@article{arxiv.2506.15980,
title = {Advanced Sign Language Video Generation with Compressed and Quantized Multi-Condition Tokenization},
author = {Cong Wang and Zexuan Deng and Zhiwei Jiang and Yafeng Yin and Fei Shen and Zifeng Cheng and Shiping Ge and Shiwei Gan and Qing Gu},
journal= {arXiv preprint arXiv:2506.15980},
year = {2025}
}