中文

通过 Token 扭曲实现零样本视频翻译

计算机视觉与模式识别 2025-11-26 v4

摘要

随着生成式 AI 的革命,视频相关任务得到了广泛研究。然而,当前的最先进视频模型在视觉质量和用户对生成内容的控制方面仍落后于图像模型。在本文中,我们介绍了 TokenWarping,一种用于时间连贯视频翻译的新型框架。现有的基于扩散的视频编辑方法仅依赖自注意力中的键(key)和值(value)补丁来确保时间一致性,往往牺牲了局部和结构区域的保留。关键在于,这些方法忽略了查询(query)补丁在实现准确特征聚合和时间连贯性方面的重要性。相比之下,TokenWarping 通过构建不同帧之间的时间相关性,利用互补的 token 先验。我们的方法首先从源视频中提取光流。在扩散模型的去噪过程中,这些光流用于扭曲前一帧的查询、键和值补丁,使其与当前帧的补丁对齐。通过直接扭曲查询补丁,我们增强了自注意力中的特征聚合,而扭曲键和值补丁则确保了帧间的时间一致性。这种 token 扭曲对自注意力层输出施加了显式约束,有效地确保了时间连贯的翻译。我们的框架不需要任何额外的训练或微调,并且可以无缝集成到现有的文本到图像编辑方法中。我们在各种视频翻译任务上进行了广泛的实验,表明 TokenWarping 在定性和定量上均超越了最先进的方法。视频演示可在我们的项目网页 https://alex-zhu1.github.io/TokenWarping/ 查看。代码地址:https://github.com/Alex-Zhu1/TokenWarping。

关键词

引用

@article{arxiv.2402.12099,
  title  = {Zero-Shot Video Translation via Token Warping},
  author = {Haiming Zhu and Yangyang Xu and Jun Yu and Shengfeng He},
  journal= {arXiv preprint arXiv:2402.12099},
  year   = {2025}
}

备注

Code is available at: https://github.com/Alex-Zhu1/TokenWarping