中文

探索联邦军事大语言模型中的潜在提示注入攻击及其缓解

机器学习 2026-05-05 v2

摘要

联邦学习(FL)越来越多地被用于军事合作中开发大型语言模型(LLM),同时保护数据主权。然而,提示注入攻击——对输入提示的恶意操纵——带来了新的威胁,可能破坏操作安全、干扰决策制定并削弱盟友间的信任。这篇观点文章强调了联邦军事LLM中的四个漏洞:秘密数据泄露、搭便车利用、系统破坏和错误信息传播。为了应对这些风险,我们提出了一个人机协作框架,包含技术和政策对策。在技术方面,我们的框架使用红/蓝队兵棋推演和质量保证来检测和缓解共享LLM权重的对抗行为。在政策方面,它促进联合AI-人类政策制定和安全协议的验证。

关键词

引用

@article{arxiv.2501.18416,
  title  = {Exploring Potential Prompt Injection Attacks in Federated Military LLMs and Their Mitigation},
  author = {Youngjoon Lee and Taehyun Park and Yunho Lee and Jinu Gong and Joonhyuk Kang},
  journal= {arXiv preprint arXiv:2501.18416},
  year   = {2026}
}

备注

Accepted to the 3rd International Workshop on Dataspaces and Digital Twins for Critical Entities and Smart Urban Communities - IEEE BigData 2025