超越黄金数据:通过时间步选择性训练解决运动-视觉质量困境
计算机视觉与模式识别
2026-04-02 v2
摘要
近期视频生成模型取得了令人瞩目的成果。然而,这些模型严重依赖同时具备高视觉质量和高运动质量的高质量数据。本文识别出视频数据整理中的关键挑战:运动-视觉质量困境。我们发现视觉质量与运动强度本质上呈负相关,难以获得在两方面均卓越的黄金数据。为应对这一挑战,我们首先考察视频扩散模型的分层学习动力学,并对质量退化样本进行基于梯度的分析。我们发现,在适当的时间步上,质量不平衡数据可产生与黄金数据相似的梯度。基于此,我们提出训练过程中时间步选择的新概念。我们提出时间步感知质量解耦 (TQD),通过修改数据采样分布使其更好地匹配模型的学习过程。对于某些类型的数据,采样分布向更高时间步倾斜以处理运动丰富数据,而高视觉质量数据更可能在较低时间步被采样。通过大量实验,我们证明 TQD 仅使用分离的不平衡数据即可训练出超越传统方法使用更优数据的性能,挑战了视频生成中完美数据的必要性。此外,该方法在高质量数据上训练时同样提升了模型性能,展示了其在不同数据场景下的有效性。
引用
@article{arxiv.2603.25527,
title = {Beyond the Golden Data: Resolving the Motion-Vision Quality Dilemma via Timestep Selective Training},
author = {Xiangyang Luo and Qingyu Li and Yuming Li and Guanbo Huang and Yongjie Zhu and Wenyu Qin and Meng Wang and Pengfei Wan and Shao-Lun Huang},
journal= {arXiv preprint arXiv:2603.25527},
year = {2026}
}
备注
Accepted to CVPR 2026