AlienLM:面向黑盒 LLM API 边界的语言隐写化
密码学与安全
2026-02-02 v1 计算与语言
摘要
现代大语言模型(LLM)日益通过黑盒 API 被访问,用户需将敏感提示词、输出内容及微调数据发送至外部提供商,导致 API 边界存在严重隐私风险。我们提出 AlienLM,一个可部署的仅 API 隐私层,通过词汇规模的双射将文本翻译为外星语言,实现无损恢复。我们仅使用标准微调 API,即可通过外星适应训练(Alien Adaptation Training, AAT)使目标模型直接处理外星化输入。在四个 LLM 主干模型和七个基准测试上,AlienLM 平均保留超过 81% 的明文或准师模型性能,显著优于随机双射和字符级基线方法。在面对拥有模型权重、语料统计信息及基于学习的逆翻译能力的对手时,恢复攻击仅能重建少于 0.22% 的外星化 token。我们的结果表明,在仅限 API 访问的场景下,AlienLM 提供了一条实用的隐私保留 LLM 部署路径,显著降低明文暴露风险,同时保持任务性能。
引用
@article{arxiv.2601.22710,
title = {AlienLM: Alienization of Language for API-Boundary Privacy in Black-Box LLMs},
author = {Jaehee Kim and Pilsung Kang},
journal= {arXiv preprint arXiv:2601.22710},
year = {2026}
}