大型语言模型对软件工程术语的理解不可靠
软件工程
2026-07-07 v1
摘要
大型语言模型(LLM)越来越多地用于软件工程(SE),但尚无系统研究确定这些LLM在多大程度上真正理解标准化的SE术语。缺乏这种理解可能导致误解和沟通不畅,无论是LLM消费文本,还是人类开发人员根据LLM生成的文本采取行动。在本文中,我们研究了最先进的LLM在多大程度上能够识别ISO/IEC/IEEE 24765:2017《系统和软件工程——词汇表》中的定义是否正确。我们向LLM提示正确的定义以及系统伪造的定义。伪造既包括语义性的(替换关键术语)也包括结构性的(删除关键信息)。我们测量分类准确率以及LLM生成的推理标记在理解定义方面是否有意义。虽然大多数LLM以高准确率检测到伪造的定义,但它们也拒绝了许多正确的定义,表明存在系统性拒绝偏差,而不是真正的判别性理解。显式推理不能持续改善结果,甚至可能通过过度思考而阻碍性能。我们的工作表明,虽然LLM(包括其智能体使用)在许多SE任务中的性能令人印象深刻,但在理解这将如何影响SE(包括术语的一致使用)方面仍存在根本性问题。
引用
@article{arxiv.2607.06004,
title = {Large Language Models Have Unreliable Understanding of Software Engineering Terminology},
author = {Huzaifa Ejaz and Fabian C. Peña and Steffen Herbold},
journal= {arXiv preprint arXiv:2607.06004},
year = {2026}
}