MAPLE:元数据增强的私有语言演化
计算与语言
2026-03-23 v1 人工智能
密码学与安全
机器学习
摘要
虽然差分隐私(DP)微调大型语言模型(LLMs)是强大的工具,但在最新模型仅通过专有 API 可用的情形下,往往计算昂贵或不可行。针对此类场景,生成 DP 合成数据已成为关键替代方案,其额外优势在于可随意复用于下游任务,并在不受模型参数空间不透明约束的前提下进行透明的探索性数据分析。私有演化(PE)是一种针对 API 方法的有前景框架;然而,其性能在初始化方面至关依赖。当私有数据分布与基础模型预训练先验显著偏离时——尤其是在高度专业化领域——PE 经常难以与目标数据对齐,导致实用性下降、收敛不佳以及 API 资源浪费。为解决此初始化瓶颈,我们提出元数据增强私有语言演化(MAPLE)。MAPLE 利用差分隐私表格元数据提取与情境学习,有效地将初始合成分布锚定于目标领域。在具有挑战性的特定领域文本生成任务上进行的广泛实验表明,MAPLE 在隐私-实用性权衡、收敛速度以及 API 成本方面均显著优于先前的 PE 方法。
引用
@article{arxiv.2603.19258,
title = {MAPLE: Metadata Augmented Private Language Evolution},
author = {Eli Chien and Yuzheng Hu and Ryan McKenna and Shanshan Wu and Zheng Xu and Peter Kairouz},
journal= {arXiv preprint arXiv:2603.19258},
year = {2026}
}
备注
Preliminary work