基于记忆化与细粒度长尾的可信机器学习:交互、权衡及展望综述
机器学习
2025-03-11 v1
摘要
记忆化在机器学习(ML)中的作用引起了广泛关注,特别是经验观察到现代模型会记忆训练数据的片段。先前的理论分析(如 Feldman 的开创性工作)将记忆化归因于训练数据中长尾分布的普遍性,证明对于位于分布尾部的样本,记忆化是不可避免的。然而,记忆化与可信 ML 研究的交叉揭示了关键的空白。虽然先前关于可信 ML 中记忆化的研究仅关注类别不平衡,但近期的工作开始区分类别层面的稀有性与非典型样本,后者是有效且罕见的类内实例。然而,一个关键的研究空白依然存在:当前的框架将非典型样本与噪声和错误数据混为一谈,忽视了它们对公平性、鲁棒性和隐私的不同影响。在这项工作中,我们对现有研究及其关于可信 ML 和记忆化作用的发现进行了全面综述。此外,我们识别并突出了未知的空白,并提出了该研究方向上的新路径。由于现有的理论和实证分析缺乏细致的辨析来解耦记忆化作为必要性与负担的双重性,我们形式化了三级长尾粒度——类别不平衡、非典型性和噪声——以揭示当前框架如何误用这些层级,从而延续有缺陷的解决方案。通过系统化这种粒度,我们为未来研究绘制了路线图。可信 ML 必须在为保障公平性而记忆非典型性与为保障鲁棒性和隐私而抑制噪声之间,调和细微的权衡。通过这种粒度重新定义记忆化,重塑了可信 ML 的理论基础,并进一步为使模型将性能与社会信任相一致提供了实证前提。
引用
@article{arxiv.2503.07501,
title = {Trustworthy Machine Learning via Memorization and the Granular Long-Tail: A Survey on Interactions, Tradeoffs, and Beyond},
author = {Qiongxiu Li and Xiaoyu Luo and Yiyi Chen and Johannes Bjerva},
journal= {arXiv preprint arXiv:2503.07501},
year = {2025}
}
备注
28 pages, 2 figures