中文

BADTV:揭示第三方任务向量中的后门威胁

机器学习 2025-03-25 v2 密码学与安全

摘要

大规模预训练模型中的任务算术(任务向量,Task Vectors)能够灵活地适应多样化的下游任务,而无需进行大量再训练。通过利用任务向量(TVs),用户可通过加法、减法等简单的算术运算执行模块化更新。然而,这种灵活性也带来了新的安全挑战。本文研究了任务向量如何易受后门攻击,揭示了恶意行为者如何利用它们损害模型完整性。通过精心设计非对称的复合后门,我们提出了 BadTV,一种专门设计的后门攻击,能够在任务学习、遗忘与类比运算下同时保持有效。大量实验表明,BadTV 在多种场景下均能达到近乎完美的攻击成功率,对依赖任务算术的模型构成严重威胁。我们还评估了现有的防御方法,发现它们无法检测或缓解 BadTV。我们的研究结果凸显了在实际部署中保障任务向量安全、制定稳健防御措施的迫切需求。

关键词

引用

@article{arxiv.2501.02373,
  title  = {BADTV: Unveiling Backdoor Threats in Third-Party Task Vectors},
  author = {Chia-Yi Hsu and Yu-Lin Tsai and Yu Zhe and Yan-Lun Chen and Chih-Hsun Lin and Chia-Mu Yu and Yang Zhang and Chun-Ying Huang and Jun Sakuma},
  journal= {arXiv preprint arXiv:2501.02373},
  year   = {2025}
}