InvBERT:通过反转 BERT 流程从上下文词嵌入重建文本
计算与语言
2024-06-05 v2
摘要
数字人文与计算文学研究将文本挖掘方法应用于文学研究。此类自动化方法使得对大型语料库的定量研究成为可能,而仅依靠人工审阅则难以实现。然而,由于版权限制,相关数字化文学作品的可用性有限。派生文本格式(DTFs)已被提出作为一种解决方案。在此,文本材料被转换为去除了版权关键特征、但仍可使用特定分析方法的形式。由 transformer 编码器(如 BERT)生成的上下文词嵌入是 DTFs 的有前景候选,因为它们在各种分析任务上可达到最先进性能,且乍看之下不会泄露原始文本。然而,本文证明在特定条件下重建原始受版权保护文本是可行的,以其上下文 token 表示形式发布并不安全。我们反转 BERT 的尝试表明,将编码器作为黑盒与上下文嵌入一同发布是危险的,因为这允许生成数据来训练解码器,其重建精度足以违反版权法。
引用
@article{arxiv.2109.10104,
title = {InvBERT: Reconstructing Text from Contextualized Word Embeddings by inverting the BERT pipeline},
author = {Kai Kugler and Simon Münker and Johannes Höhmann and Achim Rettinger},
journal= {arXiv preprint arXiv:2109.10104},
year = {2024}
}