中文

评估开源大语言模型在技术电信问答中的表现

计算机视觉与模式识别 2026-03-03 v3

摘要

大语言模型(LLM)在各个领域已展现出卓越能力。然而,它们在电信等技术领域的表现仍未被充分探索。本文评估了两个开源 LLM——Gemma 3 27B 和 DeepSeek R1 32B——在源自先进无线通信材料的基于事实和基于推理的问题上的表现。我们构建了一个包含 105 个问答对的基准,并使用词汇指标、语义相似度和 LLM-as-a-judge 评分来评估性能。我们还通过来源归因和评分方差分析了连贯性、判断可靠性和幻觉现象。结果表明,Gemma 在语义保真度和 LLM 评分正确性方面表现优异,而 DeepSeek 展现出略高的词汇连贯性。额外的发现突显了电信应用中的当前局限性,以及需要领域自适应模型来支持工程领域可信赖的人工智能(AI)助手。

关键词

引用

@article{arxiv.2509.21950,
  title  = {Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach},
  author = {Daiqing Wu and Dongbao Yang and Sicheng Zhao and Can Ma and Yu Zhou},
  journal= {arXiv preprint arXiv:2509.21950},
  year   = {2026}
}

备注

Accepted by ICLR 2026