过参数化自编码器记忆了多少训练数据?基于逆问题视角的记忆评估
机器学习
2024-06-14 v2
摘要
过参数化自编码器模型常会记忆其训练数据。对于图像数据,记忆现象常通过训练好的自编码器恢复其训练图像(训练时仅以完整形式使用)中缺失区域来考察。本文中,我们提出一种用于记忆研究的逆问题视角。给定一幅退化的训练图像,我们将原始训练图像的恢复定义为逆问题,并将其表述为优化任务。在我们的逆问题中,利用训练好的自编码器为待检索的特定训练数据集隐式定义正则化项。我们将这一复杂优化任务发展为一种实用方法,迭代地应用训练好的自编码器以及相对简单的计算来估计并处理未知退化算子。我们在盲修复(目标是从未知模式的大量缺失像素退化中恢复训练图像)上评估了该方法。我们考察了多种深度自编码器架构,如全连接与 U-Net(具不同非线性及不同训练损失值),表明我们的方法显著优于先前从自编码器恢复训练数据的记忆评估方法。重要的是,我们的方法在先前被认为极具挑战甚至不切实际的恢复与记忆评估设定下,也大幅提升了恢复性能。
引用
@article{arxiv.2310.02897,
title = {How Much Training Data is Memorized in Overparameterized Autoencoders? An Inverse Problem Perspective on Memorization Evaluation},
author = {Koren Abitbul and Yehuda Dar},
journal= {arXiv preprint arXiv:2310.02897},
year = {2024}
}