中文

奖励导向条件扩散:可证明的分布估计与奖励提升

机器学习 2023-07-17 v1

摘要

我们探索通过条件扩散模型进行奖励导向生成的方法与理论。导向生成旨在生成具有由奖励函数度量的期望属性的样本,在生成式 AI、强化学习和计算生物学中具有广泛应用。我们考虑常见的学习场景,其中数据集由无标签数据与一组带有噪声奖励标签的较小数据组成。我们的方法利用在较小数据集上学习的奖励函数作为伪标签器。从理论角度,我们表明该导向生成器能有效学习并从奖励条件数据分布中采样。此外,我们的模型能够恢复数据的潜在子空间表示。而且,我们证明该模型生成的新群体更接近用户指定的目标奖励值,其中最优性差距与特征子空间中的离策略 bandit 遗憾一致。所获得的奖励提升受奖励信号强度、分布偏移和离支持外推成本之间相互作用的影响。我们提供经验结果来验证我们的理论,并强调外推强度与生成样本质量之间的关系。

关键词

引用

@article{arxiv.2307.07055,
  title  = {Reward-Directed Conditional Diffusion: Provable Distribution Estimation and Reward Improvement},
  author = {Hui Yuan and Kaixuan Huang and Chengzhuo Ni and Minshuo Chen and Mengdi Wang},
  journal= {arXiv preprint arXiv:2307.07055},
  year   = {2023}
}