文本嵌入揭示(几乎)与文本一样多的信息
计算与语言
2023-10-11 v1 机器学习
摘要
文本嵌入揭示了关于原始文本的多少隐私信息?我们研究了嵌入\textit{反演}问题,即重构稠密文本嵌入所表示的完整文本。我们将该问题框架为受控生成:生成在重新嵌入时接近潜空间中某一固定点的文本。我们发现,尽管以嵌入为条件的朴素模型表现不佳,但一种迭代修正并重新嵌入文本的多步方法能够精确恢复 的 文本输入。我们训练模型从两个最先进的嵌入模型解码文本嵌入,并展示我们的模型可从临床笔记数据集中恢复重要个人信息(全名)。我们的代码已在 Github 上提供:\href{https://github.com/jxmorris12/vec2text}{github.com/jxmorris12/vec2text}。
引用
@article{arxiv.2310.06816,
title = {Text Embeddings Reveal (Almost) As Much As Text},
author = {John X. Morris and Volodymyr Kuleshov and Vitaly Shmatikov and Alexander M. Rush},
journal= {arXiv preprint arXiv:2310.06816},
year = {2023}
}
备注
Accepted at EMNLP 2023