中文

揭示Transformer:一种基于注意力权重的数据恢复理论方法

机器学习 2023-10-20 v1 计算与语言 机器学习

摘要

在深度学习领域,Transformer已成为主导架构,尤其在自然语言处理任务中。然而,随着其广泛采用,关于这些模型所处理数据的安全性和隐私性的担忧也随之产生。本文解决一个关键问题:能否利用Transformer的注意力权重和输出恢复输入的数据?我们引入了一个理论框架来解决该问题。具体而言,我们提出了一种算法,旨在通过最小化损失函数 L(X)L(X),从给定的注意力权重 W=QKRd×dW = QK^\top \in \mathbb{R}^{d \times d} 和输出 BRn×nB \in \mathbb{R}^{n \times n} 中恢复输入数据 XRd×nX \in \mathbb{R}^{d \times n}。该损失函数捕捉了Transformer期望输出与实际输出之间的差异。我们的发现对局部层机制(LLM, Localized Layer-wise Mechanism)具有重要意义,从安全和隐私角度表明了模型设计中潜在的漏洞。本工作强调了理解和保护Transformer内部运作以确保处理数据机密性的重要性。

关键词

引用

@article{arxiv.2310.12462,
  title  = {Unmasking Transformers: A Theoretical Approach to Data Recovery via Attention Weights},
  author = {Yichuan Deng and Zhao Song and Shenghao Xie and Chiwun Yang},
  journal= {arXiv preprint arXiv:2310.12462},
  year   = {2023}
}