BachVid:基于一致背景与角色的无训练视频生成
计算机视觉与模式识别
2025-10-27 v1
摘要
扩散转换器 (DiT) 近期在文本到视频 (T2V) 生成方面取得了显著进展。然而,生成具有一致角色和背景的多个视频仍是一个重要挑战。现有方法通常依赖参考图像或大量训练,常仅解决角色一致性,背景一致性则交由图像到视频模型处理。我们引入 BachVid,这是首个无需任何参考图像即可实现一致视频生成的无训练方法。我们的方法基于对 DiT 注意力机制和中间特征的系统性分析,揭示了其在去噪过程中提取前景掩码并识别匹配点的能力。我们利用这一发现,首先生成身份视频并缓存中间变量,然后将这些缓存变量注入到新生成视频的相应位置,确保前景和背景在多个视频中保持一致。实验结果表明,BachVid 在无需额外训练的情况下实现了视频的稳健一致性,为无需依赖参考图像或额外训练的一致视频生成提供了一种新颖且高效的解决方案。
引用
@article{arxiv.2510.21696,
title = {BachVid: Training-Free Video Generation with Consistent Background and Character},
author = {Han Yan and Xibin Song and Yifu Wang and Hongdong Li and Pan Ji and Chao Ma},
journal= {arXiv preprint arXiv:2510.21696},
year = {2025}
}
备注
Project page: https://wolfball.github.io/bachvid