SafeCOMM:关于微调电信大语言模型安全性退化的研究
计算机与社会
2026-02-09 v3 计算与语言
密码学与安全
机器学习
摘要
在电信数据集上微调大语言模型(LLM)是将通用模型适配到电信领域的常见做法。然而,很少有人关注这一过程可能如何损害模型安全性。最近的研究表明,即使是良性的微调也可能降低LLM的安全对齐,导致它们响应有害或不道德的用户查询。在本文中,我们通过在三个代表性电信数据集上微调LLM来研究这个问题,并表明即使是轻度的电信领域适配也会导致安全性退化。为此,我们引入了TeleHarm,这是第一个特定于电信的红队测试基准,我们将其与已建立的DirectHarm和HexPhi数据集一起使用,以系统地评估有害行为。我们进一步将分析扩展到在大型电信语料库上持续预训练的公开可用TeleLLM,揭示了其严重缺乏安全对齐,主要是由于省略了以安全为重点的指令微调。为了解决这些问题,我们评估了三种重新对齐防御方法:SafeInstruct、SafeLoRA和SafeMERGE。我们表明,在所有设置中,所提出的防御方法都能有效恢复安全性而不影响电信任务性能,从而产生安全的电信通信模型。我们的工作既是一项诊断研究,也是电信微调LLM安全重新对齐的实用指南,强调了电信领域内安全意识指令和微调的必要性。
引用
@article{arxiv.2506.00062,
title = {SafeCOMM: A Study on Safety Degradation in Fine-Tuned Telecom Large Language Models},
author = {Aladin Djuhera and Swanand Ravindra Kadhe and Farhan Ahmed and Syed Zawad and Fernando Koch and Walid Saad and Holger Boche},
journal= {arXiv preprint arXiv:2506.00062},
year = {2026}
}