中文

RewardSDS:通过奖励加权抽样实现评分蒸馏的对齐

计算机视觉与模式识别 2025-03-14 v2

摘要

评分蒸馏抽样(SDS)已成为有效利用二维扩散先验以实现诸如文本到三维生成等任务的技术。尽管其功能强大,但SDS在实现细粒度对齐用户意图方面存在挑战。为克服此问题,本文引入RewardSDS,一种 novel 方法,通过基于奖励模型对齐得分的噪声样本进行加权,生成加权SDS损失。该损失优先选择来自能产生高奖励输出的噪声样本的梯度。我们的方法具有广泛适用性,可扩展至SDS基方法。在本文中,我们特别演示了其对变分评分蒸馏(VSD)的适用性,通过引入RewardVSD实现。我们在文本到图像、二维编辑和文本到三维生成任务上评估了RewardSDS和RewardVSD,显示相较于SDS和VSD在衡量生成质量和与所需奖励模型对齐程度的多样化指标方面显著提升,实现了最先进的性能。项目页面可在 https://itaychachy.github.io/reward-sds/ 查看。

关键词

引用

@article{arxiv.2503.09601,
  title  = {RewardSDS: Aligning Score Distillation via Reward-Weighted Sampling},
  author = {Itay Chachy and Guy Yariv and Sagie Benaim},
  journal= {arXiv preprint arXiv:2503.09601},
  year   = {2025}
}