机器学习中的数据来源推断
机器学习
2023-01-31 v2 密码学与安全
数据库
摘要
利用机器学习模型中的非预期记忆造福现实应用是一个日益增长的方向,近期工作如用户审计、数据集所有权推断和遗忘数据度量。站在机器学习模型开发的角度,我们引入一个名为数据来源推断的过程,以协助机器学习开发者在不维护繁重元数据的情况下定位训练集中遗漏或错误的数据来源。我们正式定义了机器学习模型(主要是神经网络)开发中的数据来源与数据来源推断任务。随后我们提出一种结合嵌入空间多示例分类与影子训练的新型推断策略。多样化用例涵盖语言、视觉和结构化数据,以及各类数据来源(如业务、县、电影、移动用户、文本作者)。对我们所提策略的全面性能分析包含参考的目标模型层、每个来源可用的测试数据,以及在影子训练中的特征提取与影子模型实现。当目标模型为基于 transformer 的深度神经网络时,我们的语言用例最佳推断准确率达到 98.96%。此外,我们对不同种类数据来源给出统计分析,以探究何种来源可能被正确推断。
引用
@article{arxiv.2211.13416,
title = {Data Origin Inference in Machine Learning},
author = {Mingxue Xu and Xiang-Yang Li},
journal= {arXiv preprint arXiv:2211.13416},
year = {2023}
}