基于扩散模型生成带约束的风险样本
机器学习
2025-12-23 v1
摘要
尽管神经网络在许多任务中取得了令人期待的性能,但它们在遇到某些样本时仍可能失败,并对应用带来风险。为了发现风险样本,先前的文献尝试在现有数据集中搜索风险样本的模式,或对其进行注入扰动。然而,这种方式受限于现有数据集的覆盖范围,限制了风险样本的多样性。为克服这一限制,近期研究采用扩散模型在现有数据集之外生成新的风险样本。然而,这些方法在生成样本与预期类别的符合性方面存在挑战,这可能引入标签噪声,并严重限制其在实际应用中的有效性。为此,我们提出了 RiskyDiff,通过将文本和图像的嵌入表示作为类别符合性的隐式约束。我们还设计了符合性得分,以进一步显式强化类别符合性,同时引入嵌入筛选和风险梯度引导机制以提升生成样本的风险性。大量实验表明,RiskyDiff 在风险程度、生成质量和与条件类别的符合性方面均显著优于现有方法。我们还经验性地表明,通过使用高符合性生成样本增强训练数据,可提升模型的泛化能力。
引用
@article{arxiv.2512.18722,
title = {Generating Risky Samples with Conformity Constraints via Diffusion Models},
author = {Han Yu and Hao Zou and Xingxuan Zhang and Zhengyi Wang and Yue He and Kehan Li and Peng Cui},
journal= {arXiv preprint arXiv:2512.18722},
year = {2025}
}