衡量与消除军事大型语言模型中的拒答行为
计算与语言
2026-03-12 v1 人工智能
摘要
军事大型语言模型(LLM)必须在紧急和危险情况下为战场打击者提供准确信息。然而,当今的LLM因安全行为而导致拒绝许多合法查询,尤其是涉及暴力、恐怖主义或军事技术的问题。我们构建的拒答率基准测试由美国陆军和特种部队成员开发,是据我们所知的首个此类数据集。我们报告了31个公开模型和3个军事模型的拒答率和迂回率。我们观察到硬性拒答率最高可达98.2%,软性迂回率范围为0%至21.3%。我们还展示了两个额外合成数据集的结果及其与基准数据集的相关性。最后,我们使用Heretic库对一个军事微调的gpt-oss-20b模型进行消除实验,显示答案率提升了66.5个百分点,但其他军事任务的平均相对性能下降约2%。在我们的结论中,我们主张进行更深入的专业化,包括中期训练和端到端后训练,以实现军事模型的零拒答和最大化军事任务准确率。
引用
@article{arxiv.2603.10012,
title = {Measuring and Eliminating Refusals in Military Large Language Models},
author = {Jack FitzGerald and Dylan Bates and Aristotelis Lazaridis and Aman Sharma and Vincent Lu and Brian King and Yousif Azami and Sean Bailey and Jeremy Cao and Peter Damianov and Kevin de Haan and Joseph Madigan and Jeremy McLaurin and Luke Kerbs and Jonathan Tainer and Dave Anderson and Jonathan Beck and Jamie Cuticello and Colton Malkerson and Tyler Saltsman},
journal= {arXiv preprint arXiv:2603.10012},
year = {2026}
}
备注
30 pages