中文

多样性奖励的 CFG 蒸馏

机器学习 2024-10-10 v1

摘要

生成模型正在改变诸如音乐生成等创造领域,推理时间策略如无分类器引导 (CFG) 在其中发挥关键作用。然而,CFG 增加推理成本,限制生成内容的原始性和多样性。在本文中,我们引入多样性奖励 CFG 蒸馏,这是一种新型微调程序,用于提炼 CFG 的优势并解决其局限性。我们的ethods 优化两个训练目标:(1) 蒸馏目标,鼓励模型单独(无需 CFG)模仿 CFG 增强预测;(2) 基于多样性奖励的强化学习目标,促进给定提示生成多样化输出。通过微调,我们学习具有生成高质量且多样化输出能力的模型权重,而无需任何推理开销。这也解锁了权重基模型合并策略的潜力:通过在两个模型权重之间进行插值(第一个侧重质量,第二个侧重多样性),我们可以在部署时控制质量-多样性权衡,并进一步提升性能。我们在 MusicLM (Agostinelli 等,2023) 文本到音乐生成模型上进行了大量实验,其中我们的做法在质量-多样性 Pareto 最优方面超越了 CFG。根据人类评估员,我们微调后合并的模型生成的样本在质量-多样性方面优于使用 CFG 的基础模型。请访问 https://google-research.github.io/seanet/musiclm/diverse_music/ 了解我们的生成作品。

关键词

引用

@article{arxiv.2410.06084,
  title  = {Diversity-Rewarded CFG Distillation},
  author = {Geoffrey Cideron and Andrea Agostinelli and Johan Ferret and Sertan Girgin and Romuald Elie and Olivier Bachem and Sarah Perrin and Alexandre Ramé},
  journal= {arXiv preprint arXiv:2410.06084},
  year   = {2024}
}