重新思考时间步长采样器与预测类型
机器学习
2025-02-05 v1 计算机视觉与模式识别
摘要
扩散模型因消耗大量时间和资源而训练. 例如, 为满足极大迭代次数和大批量大小的要求, 扩散模型需要数百个 GPU 训练数周才能实现高分辨率生成任务. 扩散模型训练成为富豪的游戏. 仅能容纳小批量大小的资源受限, 训练扩散模型总是失败. 本文调查了在资源有限的情况下训练扩散模型的关键原因. 通过大量实验与演示, 我们识别出一个主要因素: 不同时间步长之间的训练损失呈现显著变动, 这会轻易破坏前几次迭代中取得的进展. 此外, 不同 的预测类型在任务和时间步长方面表现出不同的有效性. 我们假设使用混合预测方法来识别最准确的 预测类型可能作为解决此问题的突破口. 本文概述了若干挑战与见解, 希望能激发进一步的研究以克服受限资源下训练扩散模型的限制, 尤其是针对高分辨率任务.
引用
@article{arxiv.2502.01990,
title = {Rethinking Timesteps Samplers and Prediction Types},
author = {Bin Xie and Gady Agam},
journal= {arXiv preprint arXiv:2502.01990},
year = {2025}
}