中文

自消费生成模型与对抗式精选数据

机器学习 2025-05-16 v1

摘要

近期生成模型的进步使得区分真实数据与模型生成的合成数据变得越来越困难。使用合成数据对后续模型生成的训练创建“自消费循环”,可能导致模型崩溃或训练不稳定。此外,合成数据常受到人类反馈的影响并由用户根据其偏好进行精选。Ferbach 等人 (2024) 最近表明,当数据按用户偏好进行精选时,自消费再训练循环会导致模型收敛到优化这些偏好的分布。然而,在实际应用中,数据精选常常是噪声的或受对抗性操控的。例如,竞争平台可能招募恶意用户以对抗式方式精选数据,以破坏竞争对手的模型。在本文中,我们研究在噪声和对抗式精选数据的情况下,生成模型如何在自消费再训练循环中演化。我们对此类噪声数据精选对生成模型的影响进行理论分析,并确定再训练过程的鲁棒性条件。基于这一分析,我们设计了针对竞争性对抗场景的攻击算法,其中拥有有限预算的平台使用恶意用户来误导竞亡对手的模型偏离实际用户偏好。在合成数据和真实数据集上的实验表明,所提出算法的有效性。

关键词

引用

@article{arxiv.2505.09768,
  title  = {Self-Consuming Generative Models with Adversarially Curated Data},
  author = {Xiukun Wei and Xueru Zhang},
  journal= {arXiv preprint arXiv:2505.09768},
  year   = {2025}
}