探索联邦军事大语言模型中的潜在提示注入攻击及其缓解
机器学习
2026-05-05 v2
摘要
联邦学习(FL)越来越多地被用于军事合作中开发大型语言模型(LLM),同时保护数据主权。然而,提示注入攻击——对输入提示的恶意操纵——带来了新的威胁,可能破坏操作安全、干扰决策制定并削弱盟友间的信任。这篇观点文章强调了联邦军事LLM中的四个漏洞:秘密数据泄露、搭便车利用、系统破坏和错误信息传播。为了应对这些风险,我们提出了一个人机协作框架,包含技术和政策对策。在技术方面,我们的框架使用红/蓝队兵棋推演和质量保证来检测和缓解共享LLM权重的对抗行为。在政策方面,它促进联合AI-人类政策制定和安全协议的验证。
引用
@article{arxiv.2501.18416,
title = {Exploring Potential Prompt Injection Attacks in Federated Military LLMs and Their Mitigation},
author = {Youngjoon Lee and Taehyun Park and Yunho Lee and Jinu Gong and Joonhyuk Kang},
journal= {arXiv preprint arXiv:2501.18416},
year = {2026}
}
备注
Accepted to the 3rd International Workshop on Dataspaces and Digital Twins for Critical Entities and Smart Urban Communities - IEEE BigData 2025