面向隐私合成文本的可控生成
计算与语言
2025-10-01 v1 人工智能
机器学习
摘要
文本匿名化对于在医疗保健、社会服务和法律等高风险领域负责任地开发与部署人工智能至关重要。在这项工作中,我们提出了一种新颖的隐私保护合成文本生成方法,该方法利用了去识别化和“大隐于市”(HIPS)理论的原则。我们的方法引入了实体感知控制码,通过上下文学习(ICL)或前缀调优来指导可控生成。ICL变体确保了与底层去识别化系统一致的隐私水平,而前缀调优变体则结合了自定义掩码策略和损失函数,以支持可扩展的高质量生成。在法律和临床数据集上的实验表明,我们的方法在隐私保护和效用之间取得了良好的平衡,为敏感领域的合成文本生成提供了一种实用且有效的解决方案。
引用
@article{arxiv.2509.25729,
title = {Controlled Generation for Private Synthetic Text},
author = {Zihao Zhao and Anjalie Field},
journal= {arXiv preprint arXiv:2509.25729},
year = {2025}
}
备注
EMNLP 2025