Prompt-and-Check:利用大型语言模型评估模拟训练中的通信协议合规性
人工智能
2026-05-26 v1
摘要
在模拟训练中,尤其是在安全关键领域,对程序性通信合规性的准确评估至关重要,因为遵守合规检查表反映了操作能力。本文探索了一种轻量级、可部署的方法,该方法使用基于提示的推理与开源大型语言模型(LLMs),这些模型可以在消费级GPU上高效运行。我们提出了Prompt-and-Check方法,该方法利用上下文丰富的提示,仅基于转录的口头交流来评估协议中的每个检查项是否已完成。我们在海事领域进行了一项案例研究,参与者执行相同的模拟任务,并实验了LLaMA 2 7B、LLaMA 3 8B和Mistral 7B等模型,这些模型在RTX 4070 GPU上本地运行。对于每个检查项,一个包含相关转录摘录的提示被输入模型,模型输出合规性判断。我们使用分类准确率和一致性分数,根据专家标注的真实情况评估模型输出。我们的研究结果表明,提示方法能够在无需特定任务训练的情况下实现有效的上下文感知推理。本研究突显了LLMs在增强训练环境中的复盘、表现反馈和自动化评估方面的实际效用。
引用
@article{arxiv.2508.08652,
title = {Prompt-and-Check: Using Large Language Models to Evaluate Communication Protocol Compliance in Simulation-Based Training},
author = {Vishakha Lall and Yisi Liu},
journal= {arXiv preprint arXiv:2508.08652},
year = {2026}
}