Kaleido:开源多主体参考视频生成模型
计算机视觉与模式识别
2026-03-05 v2 人工智能
摘要
我们提出了 Kaleido,一种面向主体到视频 (Subject-to-Video, S2V) 的生成框架,旨在合成以多个目标主体参考图像为条件的主体一致视频。尽管近期在 S2V 生成模型方面取得了进展,但现有方法在保持多主体一致性和处理背景解缠方面仍不足,往往导致参考忠实度较低和语义漂移。这些不足可归因于几个因素:首先,训练数据集缺乏多样性和高质量样本,亦缺乏跨配对数据,即来自不同实例的组件配对样本。其次,当前整合多个参考图像的机制次佳,可能导致多主体混淆。为克服这些限制,我们提出了一个专门的数据构建管道,包含低质量样本过滤和多样化数据合成,以生产保持一致性的训练数据。此外,我们引入了参考旋转位置编码 (Reference Rotary Positional Encoding, R-RoPE) 来处理参考图像,实现稳定且精确的多图像整合。大量实验表明,Kaleido 在一致性、忠实度和泛化能力方面显著优于先前方法,标志着 S2V 生成的一次突破。
引用
@article{arxiv.2510.18573,
title = {Kaleido: Open-Sourced Multi-Subject Reference Video Generation Model},
author = {Zhenxing Zhang and Jiayan Teng and Zhuoyi Yang and Tiankun Cao and Cheng Wang and Xiaotao Gu and Jie Tang and Dan Guo and Meng Wang},
journal= {arXiv preprint arXiv:2510.18573},
year = {2026}
}
备注
21 pages, 7 figures