通过自监督视觉编码器的多特征融合与对齐提升视频扩散变换器训练
计算机视觉与模式识别
2025-09-12 v1 人工智能
摘要
视频扩散模型近年来因一系列架构创新(如扩散变换器)和新训练目标(如流匹配)而取得了快速进展。相比之下, 对提高此类模型特征表示能力的关注仍较少。本文我们展示, 可通过对齐视频生成器的中间特征与预训练视觉编码器的特征表示来增强视频扩散模型的训练。我们提出了一种新指标, 并深入分析 various视觉编码器以评估其判别性和时序一致性, 从而评估其适用于视频特征对齐的 suitability。基于分析结果, 我们提出了 Align4Gen, 提供一种集成到视频扩散模型训练中的新型多特征融合与对齐方法。我们对 Align4Gen 在无条件和类别条件视频生成任务进行评估, 并表明其结果在各种指标下均提升了视频生成质量。完整视频结果可在我们的项目页面上查看: https://align4gen.github.io/align4gen/
引用
@article{arxiv.2509.09547,
title = {Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders},
author = {Dohun Lee and Hyeonho Jeong and Jiwook Kim and Duygu Ceylan and Jong Chul Ye},
journal= {arXiv preprint arXiv:2509.09547},
year = {2025}
}
备注
17 pages, 14 figures