中文

基于简单而有效的时空解耦表示的身份保持文本到视频生成

计算机视觉与模式识别 2025-10-28 v3

摘要

身份保持文本到视频(IPT2V)生成,旨在创建具有一致人类身份的高保真视频,已成为下游应用的关键。然而,当前的端到端框架存在一个关键的时空权衡:优化关键元素(例如,人物身份保持)的空间连贯布局通常会损害符合指令的时间平滑性,而优先考虑动态真实性则可能破坏视觉结构的空间连贯性。为了解决这个问题,我们提出了一个简单而有效的时空解耦框架,将表示分解为用于布局的空间特征和用于运动动态的时间特征。具体来说,我们的论文提出了一种语义提示优化机制和分阶段解耦生成范式。前者模块将提示解耦为空间和时间组件。与后续的分阶段解耦方法相一致,空间提示指导文本到图像(T2I)阶段生成连贯的空间特征,而时间提示则指导后续的图像到视频(I2V)阶段以确保运动一致性。实验结果验证了我们的方法实现了优异的时空一致性,在身份保持、文本相关性和视频质量方面表现出色。通过利用这种简单而稳健的机制,我们的算法在2025年ACM多媒体挑战赛中获得了亚军。我们的代码可在 https://github.com/rain152/IPVG 获取。

关键词

引用

@article{arxiv.2507.04705,
  title  = {Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations},
  author = {Yuji Wang and Moran Li and Xiaobin Hu and Ran Yi and Jiangning Zhang and Han Feng and Weijian Cao and Yabiao Wang and Chengjie Wang and Lizhuang Ma},
  journal= {arXiv preprint arXiv:2507.04705},
  year   = {2025}
}

备注

ACM Multimedia 2025; code URL: https://github.com/rain152/IPVG