中文

该损失是否具有信息量?通过追踪目标动态实现更快速的文本到图像定制

计算机视觉与模式识别 2023-11-02 v3 机器学习

摘要

文本到图像生成模型代表了图像合成演进的下一步,提供了一种自然的方式来实现灵活而细粒度的结果控制。一个新兴的研究领域是将大型文本到图像模型快速适配到较小数据集或新视觉概念。然而,许多高效的适配方法训练时间长,限制了其实用应用、拖慢实验并耗费过多 GPU 资源。在本工作中,我们研究了流行文本到图像个性化方法(如 Textual Inversion 或 DreamBooth)的训练动态,旨在加速它们。我们观察到大多数概念在早阶段即被学习且后续质量不再提升,但标准训练收敛指标未能指示这一点。相反,我们提出了一种简单的即插即用早停准则,仅需在全部训练迭代中对固定输入集计算常规训练目标。我们在 Stable Diffusion 上针对 48 个不同概念与三种个性化方法的实验证明了我们方法的竞争力,其使适配速度提升高达 8 倍且质量无显著下降。

关键词

引用

@article{arxiv.2302.04841,
  title  = {Is This Loss Informative? Faster Text-to-Image Customization by Tracking Objective Dynamics},
  author = {Anton Voronov and Mikhail Khoroshikh and Artem Babenko and Max Ryabinin},
  journal= {arXiv preprint arXiv:2302.04841},
  year   = {2023}
}

备注

Accepted to Conference on Neural Information Processing Systems (NeurIPS) 2023. 20 pages, 15 figures. Code: https://github.com/yandex-research/DVAR