中文

DeepSeek-V3、GPT-4、Phi-4 和 LLaMA-3.3 在 LoRaWAN 相关工程任务中生成正确代码

软件工程 2025-04-09 v3

摘要

本文考察了 16 个大语言模型(LLM)在自动化 LoRaWAN 相关工程任务中的性能,这些任务涉及无人机最优布置和接收功率计算,使用逐步复杂化的零样本、自然语言提示。主要研究问题是轻量级、在本地运行的 LLM 是否能够为这些任务生成正确的 Python 代码。为评估此问题,我们将本地运行的模型与最先进的替代方案(如 GPT-4 和 DeepSeek-V3)进行比较,后者作为参考点。通过提取和执行每个模型生成的 Python 函数,我们在零到五的比例尺上评估其输出。结果显示,尽管 DeepSeek-V3 和 GPT-4 持续提供准确解决方案,但某些较小模型——特别是 Phi-4 和 LLaMA-3.3 ——也表现出色,凸显了轻量级替代方案的可行性。其他模型则表现出不完整理解或语法问题导致的错误。这些发现说明了 LLM 方法在专业工程应用中的潜力,同时强调了在实现可靠结果方面需要谨慎选择模型、严谨的提示设计和针对性的领域微调。

关键词

引用

@article{arxiv.2502.14926,
  title  = {DeepSeek-V3, GPT-4, Phi-4, and LLaMA-3.3 generate correct code for LoRaWAN-related engineering tasks},
  author = {Daniel Fernandes and João P. Matos-Carvalho and Carlos M. Fernandes and Nuno Fachada},
  journal= {arXiv preprint arXiv:2502.14926},
  year   = {2025}
}

备注

The peer-reviewed version of this paper is published in Electronics at https://doi.org/10.3390/electronics14071428. This version is typeset by the authors and differs only in pagination and typographical detail