中文

面向陆军领域的开源大语言模型微调与评估

计算与语言 2024-10-29 v1 人工智能 机器学习 神经与进化计算

摘要

近年来,大语言模型(LLM)的广泛采用激发了人们对其在军事领域应用潜力的兴趣。然而,由于领域特定词汇和行话的普遍存在,当前一代 LLM 在陆军用例中表现出次优性能。为了在领域内充分利用 LLM,许多机构已转向微调,以规避从头训练新 LLM 所需的极高成本。鉴于这一趋势,我们探索了将开源 LLM 适配于陆军领域使用的可行性,以解决其当前缺乏领域特异性的问题。我们的研究促成了三代不同的 TRACLM 的创建,这是由陆军未来司令部(AFC)研究与分析中心(TRAC)微调的 LLM 家族。通过不断完善我们的训练流程,TRACLM 的每次迭代在应用于陆军任务和用例时都展现出更强的能力。此外,在整个微调实验过程中,我们认识到需要一个客观量化 LLM 陆军领域特定知识的评估框架。为此,我们开发了 MilBench,这是一个可扩展的软件框架,利用源自条令和评估的任务高效评估给定 LLM 的陆军知识。我们分享了关于 TRACLM 和 MilBench 创建的初步结果、模型、方法和建议。我们的工作为整个国防部(DoD)的 LLM 技术发展提供了重要参考,并增强了高级领导者关于人工智能集成的决策。

关键词

引用

@article{arxiv.2410.20297,
  title  = {Fine-Tuning and Evaluating Open-Source Large Language Models for the Army Domain},
  author = {Daniel C. Ruiz and John Sell},
  journal= {arXiv preprint arXiv:2410.20297},
  year   = {2024}
}