中文

基于长尾引导扩散的生成式数据挖掘

机器学习 2025-06-30 v2 人工智能

摘要

预测模型一旦部署,其将遇到的无数挑战是难以预料的。常见的做法是一种被动的、周期性的方法:模型部署、数据挖掘和重新训练。我们转而通过在训练期间想象额外的数据,开发了一种主动的长尾发现过程。具体来说,我们开发了通用的基于模型的长尾信号,包括一种可微分的、单次前向传播的认知不确定性公式,该公式不影响模型参数或预测性能,但能标记出罕见或困难的输入。我们利用这些信号作为引导,在一种我们称之为长尾引导(Longtail Guidance, LTG)的过程中,从潜在扩散模型生成额外的训练数据。至关重要的是,我们可以在不重新训练扩散模型或预测模型的情况下执行 LTG,并且无需将预测模型暴露于中间的扩散状态。由 LTG 生成的数据表现出语义上有意义的变异,在众多图像分类基准上带来了显著的泛化改进,并且可以通过视觉语言模型(VLM)进行分析,以主动发现、用文本解释并解决已部署预测模型中的概念性差距。

关键词

引用

@article{arxiv.2502.01980,
  title  = {Generative Data Mining with Longtail-Guided Diffusion},
  author = {David S. Hayden and Mao Ye and Timur Garipov and Gregory P. Meyer and Carl Vondrick and Zhao Chen and Yuning Chai and Eric Wolff and Siddhartha S. Srinivasa},
  journal= {arXiv preprint arXiv:2502.01980},
  year   = {2025}
}

备注

20 pages