利用大语言模型评估 Web 应用的可信度
密码学与安全
2026-03-26 v1
摘要
Web 应用的广泛采用使其安全性成为一个关键问题,并增加了对系统性评估方法的需求,以判断它们是否可以被认为是可信的。然而,“信任”评估仍然是一个开放性问题,因为现有技术主要侧重于检测已知漏洞或依赖人工评估,这限制了它们的可扩展性;因此,评估对安全编码实践的遵循情况提供了一种互补的、务实的视角,侧重于可观察的开发行为。在实践中,安全编码实践的识别和验证主要依靠人工执行,依赖专家知识和代码审查,这既耗时、主观又难以扩展。本研究提出了一种经验性方法,通过利用大语言模型(LLM)来验证对安全编码实践的遵循情况,从而实现 Web 应用可信度评估的自动化。我们对五种最先进的 LLM 的提示工程技术进行了比较分析,范围从基线零样本分类到带有语义定义、源自调用图的结构上下文以及显式指令指导的提示。此外,我们提出了一种基于偏好逻辑评分(LSP)的分层质量模型(QM)的扩展,其中 LLM 输出被用于填充模型的质量属性并计算整体的可信度分数。实验结果表明,过多的结构上下文会引入噪声,而基于规则的指令提示则能提高评估的可靠性。由此产生的可信度分数能够区分安全和不安全的实现,支持了使用 LLM 进行可扩展且上下文感知的信任评估的可行性。
引用
@article{arxiv.2603.23781,
title = {Leveraging Large Language Models for Trustworthiness Assessment of Web Applications},
author = {Oleksandr Yarotskyi and José D'Abruzzo Pereira and João R. Campos},
journal= {arXiv preprint arXiv:2603.23781},
year = {2026}
}