面向生成模型训练的自校正自消耗循环
机器学习
2024-06-11 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
随着合成数据质量的提高和在互联网上的激增,机器学习模型越来越多地在人类和机器生成数据的混合体上进行训练。尽管使用合成数据进行表示学习有成功案例,但将合成数据用于生成模型训练会产生“自消耗循环”,除非满足特定条件,否则可能导致训练不稳定甚至崩溃。本文旨在稳定自消耗生成模型训练。我们的理论结果表明,通过引入一个理想化的校正函数,将数据点映射为在真实数据分布下更可能出现的点,可以使自消耗循环的稳定性呈指数级提升。随后,我们提出了自校正函数,这些函数依赖于专家知识(例如模拟器中编程的物理定律),旨在自动且大规模地逼近理想化校正器。我们在具有挑战性的人体运动合成任务上实证验证了自校正自消耗循环的有效性,并观察到即使合成数据与真实数据的比例高达100%,它也能成功避免模型崩溃。
引用
@article{arxiv.2402.07087,
title = {Self-Correcting Self-Consuming Loops for Generative Model Training},
author = {Nate Gillman and Michael Freeman and Daksh Aggarwal and Chia-Hong Hsu and Calvin Luo and Yonglong Tian and Chen Sun},
journal= {arXiv preprint arXiv:2402.07087},
year = {2024}
}
备注
Camera ready version (ICML 2024). Code at https://nategillman.com/sc-sc.html