中文

TMIQ:量化大语言模型在测试与测量领域的智能水平

人工智能 2025-08-05 v1

摘要

测试与测量领域以对准确性和效率的严格要求而闻名,该领域正越来越多地采用生成式 AI 技术来提升数据分析、自动化和决策过程的性能。其中,大语言模型在推进测试的自动化和精度方面展现出巨大潜力。然而,对这一专业领域中 LLM 的评估仍然探索不足。为了填补这一空白,我们引入了测试与测量智商(TMIQ),这是一个旨在跨广泛电子工程任务定量评估 LLM 的基准。TMIQ 提供了一套全面的场景和指标以进行详细评估,包括 SCPI 命令匹配准确率、排序响应评估、思维链推理以及 LLM 所需的输出格式变化对性能的影响。在测试各种 LLM 时,我们的结果表明其熟练程度存在差异,精确的 SCPI 命令匹配准确率从约 56% 到 73% 不等,而表现最佳的模型在排序匹配第一位的得分约为 33%。我们还评估了 token 用量、成本效率和响应时间,识别了准确率与运营效率之间的权衡。此外,我们提供了一个命令行界面(CLI)工具,使用户能够使用相同的方法生成数据集,从而实现对 LLM 的定制评估。TMIQ 和该 CLI 工具为在生产环境中评估 LLM 提供了严格、可复现的手段,有助于持续监控并识别优势与改进领域,推动测试与测量行业中应用选择的创新。

关键词

引用

@article{arxiv.2503.02123,
  title  = {TMIQ: Quantifying Test and Measurement Domain Intelligence in Large Language Models},
  author = {Emmanuel A. Olowe and Danial Chitnis},
  journal= {arXiv preprint arXiv:2503.02123},
  year   = {2025}
}

备注

accepted in IEEE I2MTC 2025