中文

检测生成模型记忆热点的数据制图

机器学习 2025-09-03 v1 人工智能 计算与语言

摘要

现代生成模型风险过拟合,可能无意中记住少量训练样本,这些样本可被对手提取,或人为制造基准性能的提升。我们提出生成数据制图 (GenDataCarto),一种数据中心框架,为每个预训练样本赋予难度分数(早期 epoch 损失)和记忆分数(“遗忘事件”发生频率),随后将样本划分为四个象限,以指导针对性修剪和加/减权。我们证明,记忆分数在光滑性假设下上界为经典影响,且对高记忆热点进行减权可通过统一稳定性界限显著减小泛化差距。经验上,GenDataCarto 在仅进行 10% 数据修剪的情况下,将合成 canary 提取成功率降低超过 40%,而验证困惑度的提升不足 0.5%。这些结果表明,原则性的数据干预可显著缓解数据泄露风险,同时对生成性能影响有限。

关键词

引用

@article{arxiv.2509.00083,
  title  = {Data Cartography for Detecting Memorization Hotspots and Guiding Data Interventions in Generative Models},
  author = {Laksh Patel and Neel Shanbhag},
  journal= {arXiv preprint arXiv:2509.00083},
  year   = {2025}
}

备注

6 pages, 2 figures, 1 table; Presented at the 42nd International Conference on Machine Learning (ICML), winning the "Best Poster" award at ICML's workshop for data in generative models (DIG-BUGS)