中文

基于模型的大语言模型作为服务的定制化

机器学习 2026-02-17 v5 人工智能 密码学与安全

摘要

来自 OpenAI 和 Google 等提供商的突出大语言模型(LLM)服务在通用任务方面表现出色,但在特定领域应用时常表现不足。当前这些 LLM 的定制服务通常需要用户上传数据进行微调,带来显著的隐私风险。虽然差分隐私(DP)数据合成是一种潜在替代方案,但其应用常常因引入过多噪声而导致效果低下。为此,我们引入 Llamdex,一个新的框架,使 LLM 定制化可作为服务提供,客户端上传预训练的领域特定模型而非数据。该客户端上传的模型可选用DP保护,噪声水平显著降低,然后通过连接模块插入到基础 LLM 中。显著的是,这些连接模块无需依赖敏感领域数据即可进行训练,使客户端能够在保留数据隐私的同时定制化 LLM 服务。实验表明,在相同的隐私约束下,Llamdex 相对于最先进的私有数据合成方法在领域特定准确性上提升了最高 26%;此外,由于无需用户在查询中提供领域上下文,推理效率可与原始 LLM 服务相当。

关键词

引用

@article{arxiv.2410.10481,
  title  = {Model-based Large Language Model Customization as Service},
  author = {Zhaomin Wu and Jizhou Guo and Junyi Hou and Bingsheng He and Lixin Fan and Qiang Yang},
  journal= {arXiv preprint arXiv:2410.10481},
  year   = {2026}
}

备注

Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)