中文

评估大语言模型与提示策略用于从文本用户报告中进行自动硬件诊断

机器学习 2025-07-02 v1

摘要

计算机制造商提供平台,让用户使用文本报告描述设备故障,例如“我的屏幕在闪烁”。从报告中识别故障组件对于自动化测试和改善用户体验至关重要。然而,这些报告常常模糊且缺乏细节,使得该任务具有挑战性。大型语言模型(LLM)在解决此类问题方面显示出前景。本研究评估了27个开源模型(参数量从1B到72B)和2个专有LLM,采用四种提示策略:零样本、少样本、链式思考(CoT)以及CoT+少样本(CoT+FS)。我们进行了98,948次推理,处理了超过5100万个输入token,生成了1300万个输出token。我们实现了最高达到0.76的F1分数。结果表明,三款模型在规模与性能之间提供了最佳平衡:mistral-small-24b-instruct 以及两款较小的模型,llama-3.2-1b-instruct 和 gemma-2-2b-it,这些模型在较低的显存占用下实现了竞争性能,能够在现代笔记本电脑或配备NPU的智能手机等终端用户设备上进行高效推理。

关键词

引用

@article{arxiv.2507.00742,
  title  = {Evaluating LLMs and Prompting Strategies for Automated Hardware Diagnosis from Textual User-Reports},
  author = {Carlos Caminha and Maria de Lourdes M. Silva and Iago C. Chaves and Felipe T. Brito and Victor A. E. Farias and Javam C. Machado},
  journal= {arXiv preprint arXiv:2507.00742},
  year   = {2025}
}

备注

To be published in the Proceedings of the Brazilian Integrated Software and Hardware Seminar 2025 (SEMISH 2025)