面向关键任务小型语言模型的多模型合成训练
计算与语言
2026-04-14 v2 人工智能
机器学习
摘要
大型语言模型 (LLM) 已在许多领域展现出卓越的能力,但其在专业领域的应用仍受限于领域特定训练数据的稀缺性和复杂性。我们提出了一种新颖的方法,通过将 LLM 作为一次性教师而非直接用于推理,为海事情报实现了 261 倍的成本降低。我们的方法通过多模型生成(GPT-4o 和 o3-mini),将 32 亿条自动识别系统 (AIS) 船舶跟踪记录转换为 21,543 个合成问答对,防止了过拟合并确保了准确的推理。由此微调得到的 Qwen2.5-7B 模型在海事任务上达到了 75% 的准确率,同时比使用更大的模型进行推理便宜得多。我们表明,更小、更便宜的模型——在适当微调后——可以提供与成本高昂的大型模型相似的准确率。我们的工作为面向专业 AI 应用的合成数据集生成这一新兴领域做出了贡献,并为人工标注不可行的领域提供了一个高度可复现的框架。除了拓展专业小型语言模型这一新兴领域的研究外,我们的方法在海事安全、安保行动以及各行业的船舶交通管理系统中具有直接应用价值。
引用
@article{arxiv.2509.13047,
title = {Multi-Model Synthetic Training for Mission-Critical Small Language Models},
author = {Nolan Platt and Pragyansmita Nayak},
journal= {arXiv preprint arXiv:2509.13047},
year = {2026}
}
备注
8 pages. Accepted as a full paper to the 3rd International Conference on Foundation and Large Language Models (IEEE FLLM) 2025