RefAlign: 参考到视频生成中的表示对齐
计算机视觉与模式识别
2026-03-27 v1
摘要
参考到视频(R2V)生成是一种可控的视频合成范式,通过文本提示和参考图像共同约束生成过程,实现了个性化广告和虚拟试穿等应用。在实践中,现有的R2V方法通常在参考图像的VAE潜在表示之外引入额外的高层语义或跨模态特征,并将它们联合输入扩散Transformer(DiT)。这些辅助表示提供了语义指导并充当隐式对齐信号,可以部分缓解VAE潜在空间中的像素级信息泄漏。然而,它们可能仍然难以解决由异构编码器特征之间的模态不匹配导致的复制-粘贴伪影和多主体混淆问题。在本文中,我们提出了RefAlign,一个表示对齐框架,将DiT参考分支特征显式地对齐到视觉基础模型(VFM)的语义空间。RefAlign的核心是一个参考对齐损失,它将同一主体的参考特征和VFM特征拉近以提高身份一致性,同时将不同主体的对应特征推开以增强语义区分性。这种简单而有效的策略仅在训练期间应用,不产生推理时开销,并在文本可控性和参考保真度之间取得了更好的平衡。在OpenS2V-Eval基准上的广泛实验表明,RefAlign在TotalScore上超越了当前最先进的方法,验证了显式参考对齐对R2V任务的有效性。
引用
@article{arxiv.2603.25743,
title = {RefAlign: Representation Alignment for Reference-to-Video Generation},
author = {Lei Wang and YuXin Song and Ge Wu and Haocheng Feng and Hang Zhou and Jingdong Wang and Yaxing Wang and jian Yang},
journal= {arXiv preprint arXiv:2603.25743},
year = {2026}
}
备注
17 pages, 11 figures