中文

为索引量身定制数据所付出的代价:针对学习型索引结构的投毒攻击

密码学与安全 2022-03-01 v2 数据库 数据结构与算法 机器学习

摘要

学习型索引结构的概念依赖于这样一种思想:数据库索引的输入-输出功能可视为一项预测任务,从而可使用机器学习模型而非传统算法技术来实现。这一针对数十年老问题的新视角激发了机器学习与数据结构交叉领域大量令人振奋的成果。然而,学习型索引结构的主要优势,即通过底层ML模型调整以适应手头数据的能力,从安全角度看可能成为劣势并被利用。本工作中,我们首次研究针对学习型索引结构的投毒攻击。所需的投毒方法不同于以往所有工作,因为受攻击模型训练于累积分布函数(CDF)上,因此训练集上的每次注入都会对多个数据值产生级联影响。我们构建了针对训练于CDF上的线性回归模型的首次投毒攻击,而该模型是所提学习型索引结构的基本构建块。我们将投毒技术推广以攻击一种更先进的两阶段学习型索引结构设计——递归模型索引(RMI),其已被证明优于传统B树。我们在真实世界和合成数据集上,在模型的多种参数化设置下评估了攻击,表明RMI的误差增加高达300×300\times,其第二阶段模型的误差增加高达3000×3000\times

关键词

引用

@article{arxiv.2008.00297,
  title  = {The Price of Tailoring the Index to Your Data: Poisoning Attacks on Learned Index Structures},
  author = {Evgenios M. Kornaropoulos and Silei Ren and Roberto Tamassia},
  journal= {arXiv preprint arXiv:2008.00297},
  year   = {2022}
}

备注

Preliminary version appeared in the Proceedings of the ACM International Conference on Management of Data 2022 (SIGMOD'22)