语义噪声初始化从图像迁移到视频?一项配对诊断性研究
计算机视觉与模式识别
2026-03-10 v1 人工智能
摘要
语义噪声初始化被报告可提高图像扩散模型的鲁棒性和可控性。是否将这些收益迁移到文本到视频 (T2V) 生成仍不清楚,因为时间耦合可能引入额外的自由度和不稳定性。我们使用冻结的 VideoCrafter 风格 T2V 扩散主干模型和VBench对100个提示进行基准测试。采用提示级别的配对测试、bootstrap 置信区间和符号翻转置换检验,我们观察到在时序相关维度上存在小幅正向趋势;然而,95%置信区间包含零 (p ~ 0.17),总体得分与基线相当。为理解这一结果,我们分析噪声空间中诱导的扰动,发现模式与弱或不稳定信号相符。我们建议在研究 T2V 扩散的初始化方案时,采用提示级别的配对评估和噪声空间诊断作为标准做法。
引用
@article{arxiv.2603.06672,
title = {Does Semantic Noise Initialization Transfer from Images to Videos? A Paired Diagnostic Study},
author = {Yixiao Jing and Chaoyu Zhang and Zixuan Zhong and Peizhou Huang},
journal= {arXiv preprint arXiv:2603.06672},
year = {2026}
}
备注
8 pages, 1 figure. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence: Next Token Prediction & Beyond