解构信任:低秩 LLM 中的隐私、对抗鲁棒性、伦理与公平性
机器学习
2026-05-01 v5 人工智能
摘要
大型语言模型 (LLM) 推动了多个领域的重大进展,但其巨大规模阻碍了在资源受限的环境中部署。低秩分解通过压缩模型来有效降低计算和内存消耗,同时保持准确性。尽管这些压缩模型具备良好的性能和系统级优势,但其可信度影响仍 poorly 理解。在本文中,我们首次全面研究低秩分解如何影响 LLM 可信度,涵盖隐私、对抗鲁棒性、伦理和公平性,并辅以对内部机制及这些信任相关变更背后机制的解释性分析。我们评估了不同规模和架构的多个 LLM,使用各种低秩分解算法进行压缩,揭示了关键见解:(1) 低秩分解保留了训练数据隐私,但在对话中削弱了对可识别个人信息的保护;(2) 在压缩下,对抗鲁棒性通常得到提升;(3) 在零样提示下伦理性能下降,但在少样提示下部分恢复;(4) 在压缩下公平性下降。除压缩外,我们还研究模型规模和微调对可信度的影响。此外,为超越黑箱分析,我们采用梯度基归因方法识别 LLM 哪些层对对抗鲁棒性贡献最大。
引用
@article{arxiv.2511.22099,
title = {Decomposed Trust: Privacy, Adversarial Robustness, Ethics, and Fairness in Low-Rank LLMs},
author = {Daniel Agyei Asante and Md Mokarram Chowdhury and Yang Li},
journal= {arXiv preprint arXiv:2511.22099},
year = {2026}
}
备注
Accepted to ACL 2026