SafeLM:面向可信Federated大语言模型的统一隐私感知优化
密码学与安全
2026-04-21 v1 机器学习
摘要
大语言模型(LLM)正在被部署到高风险领域,但对其交叉安全挑战的统一处理仍缺乏。我们提出SafeLM框架,联合解决LLM安全的四大支柱:隐私、安全、误导和对抗鲁棒性。SafeLM将联邦训练与梯度智能化和帕利器加密相结合实现隐私保护,集成对训练和推理时攻击的防御措施,采用对比 grounding 结合校准解码以减少幻觉现象,引入面向对齐的二值化聚合以提升鲁棒性同时保持受限的重构质量。在事实性、毒性和成员推断等基准测试上,SafeLM实现98.0%的有害内容检测准确率,将通信量降低96.9%,梯度逆转 PSNR从31.7 dB降至15.1 dB。消融实验表明,各组件独立贡献,集成后可为可信LLM部署实现强劲的隐私-实用性-效率权衡。
引用
@article{arxiv.2604.16606,
title = {SafeLM: Unified Privacy-Aware Optimization for Trustworthy Federated Large Language Models},
author = {Noor Islam S. Mohammad and Uluğ Bayazıt},
journal= {arXiv preprint arXiv:2604.16606},
year = {2026}
}