超越效率的提示:揭露小型语言模型中的潜在威胁
超导电性
2025-05-05 v2 介观与纳米尺度物理
摘要
小型语言模型(SLMs)因其高效性和低计算成本而日益在边缘设备上得到广泛部署。尽管研究人员通过创新的训练策略和模型压缩技术不断提升SLMs的能力,但SLMs的安全风险相较于大型语言模型(LLMs)受到的关注仍不足。为填补这一空白,我们提供了一项全面的实证研究,评估了13种最新SLMs在各种越狱攻击下的安全性能。我们的实验表明,大多数SLMs都相当容易受到现有越狱攻击的攻击,而其中一些甚至容易受到直接有害提示的攻击。为 addressing 安全 concerns,我们评估了几种代表性的防御方法,并展示了它们在增强SLMs安全性方面的有效性。我们进一步分析了不同SLM技术(包括架构压缩、量化、知识蒸馏等)可能导致的安全性能下降。我们期望我们的研究能够凸显SLMs的安全挑战,并为未来开发更稳健和安全的SLMs提供有价值的见解。
引用
@article{arxiv.2502.19882,
title = {Topological phase transitions in superconductors with chiral symmetry},
author = {Kristian Løvås Svalland and Maria Teresa Mercaldo and Mario Cuoco},
journal= {arXiv preprint arXiv:2502.19882},
year = {2025}
}
备注
15 pages; 13 figures