中文

SafeLM:面向可信Federated大语言模型的统一隐私感知优化

密码学与安全 2026-04-21 v1 机器学习

摘要

大语言模型(LLM)正在被部署到高风险领域,但对其交叉安全挑战的统一处理仍缺乏。我们提出SafeLM框架,联合解决LLM安全的四大支柱:隐私、安全、误导和对抗鲁棒性。SafeLM将联邦训练与梯度智能化和帕利器加密相结合实现隐私保护,集成对训练和推理时攻击的防御措施,采用对比 grounding 结合校准解码以减少幻觉现象,引入面向对齐的二值化聚合以提升鲁棒性同时保持受限的重构质量。在事实性、毒性和成员推断等基准测试上,SafeLM实现98.0%的有害内容检测准确率,将通信量降低96.9%,梯度逆转 PSNR从31.7 dB降至15.1 dB。消融实验表明,各组件独立贡献,集成后可为可信LLM部署实现强劲的隐私-实用性-效率权衡。

关键词

引用

@article{arxiv.2604.16606,
  title  = {SafeLM: Unified Privacy-Aware Optimization for Trustworthy Federated Large Language Models},
  author = {Noor Islam S. Mohammad and Uluğ Bayazıt},
  journal= {arXiv preprint arXiv:2604.16606},
  year   = {2026}
}