BeamClean:面向语言的嵌入重构
密码学与安全
2025-05-21 v1
摘要
本文考虑一种对目标输入嵌入进行逆向攻击的情形,即对发送给服务器上的语言模型的嵌入进行隐写,其中攻击者无法访问语言模型或隐写机制,仅看到被隐写后的嵌入以及模型的嵌入表。我们提出 BeamClean,一种逆向攻击方法,通过整合语言模型先验,联合估计噪声参数并解码 token 序列。对于拉普拉斯和高斯隐写机制,BeamClean 总是超越基于距离的简单攻击。本工作凸显了更先进学习型、输入依赖方法的必要性与鲁棒性。
引用
@article{arxiv.2505.13758,
title = {BeamClean: Language Aware Embedding Reconstruction},
author = {Kaan Kale and Kyle Mylonakis and Jay Roberts and Sidhartha Roy},
journal= {arXiv preprint arXiv:2505.13758},
year = {2025}
}
备注
9 pages, 5 figures, under review at NeurIPS, 2025