中文

Co(ve)rtex:作为存储通道的ML模型及其(误)应用

机器学习 2024-05-14 v3 信息论 math.IT

摘要

机器学习(ML)模型被过度参数化以支持泛化并避免过拟合。就主模型而言,这些参数的状态本质上是“无关态”,只要该状态不干扰主模型。在硬件与软件系统中,无关态与未定义行为已被证明是重大漏洞的来源。本文中,我们提出该问题的一种新的信息论视角;我们将ML模型视为一个存储通道,其容量随过度参数化而增加。具体而言,我们考虑一个发送方在训练时将任意信息嵌入模型,接收方可通过黑盒访问已部署模型提取该信息。我们基于可用未使用参数的数量推导了通道容量的上界。随后我们探索黑盒写入与读取原语,使攻击者能够:(i)通过在发送方侧扩充训练数据,以优化方式在模型内存储数据;(ii)在模型部署后通过查询读取数据。我们还考虑了该问题的一个新版本,其将信息存储隐蔽性纳入考量。具体地,为获得存储隐蔽性,我们引入一新约束,使用于写入原语的数据扩充与初始(基线任务)分布的分布偏移最小。该约束引入了与初始任务的一定程度“干扰”,从而限制了通道的有效容量。因此,我们开发了在此情形下提升容量的优化方法,包括一种新颖的基于ML特定替换的纠错协议。我们相信所提问题建模为更好理解与缓解ML潜在漏洞提供了新工具,尤其在日益庞大的模型背景下。

关键词

引用

@article{arxiv.2307.08811,
  title  = {Co(ve)rtex: ML Models as storage channels and their (mis-)applications},
  author = {Md Abdullah Al Mamun and Quazi Mishkatul Alam and Erfan Shayegani and Pedram Zaree and Ihsen Alouani and Nael Abu-Ghazaleh},
  journal= {arXiv preprint arXiv:2307.08811},
  year   = {2024}
}