中文

通过教师引导的检索增强生成解决漏洞分析中的冲突

计算与语言 2026-04-17 v1 人工智能

摘要

大语言模型(LLM)在网络安全漏洞分析中至关重要。然而,过去十年间发现了超过20万个漏洞,其中3多万个已被更改或更新。这使得维持LLM训练数据集和内部知识库的最新性成为挑战,导致知识冲突、事实性错误结果的生成以及幻觉现象。本文聚焦CVE(Common Vulnerabilities and Exposures)检测与分析中的知识差异与冲突问题。我们提出一种创新性的两阶段框架CRVA-TGRAG(Conflict Resolution in Vulnerability Analysis via Teacher-Guided Retrieval-Augmented Generation)。首先,通过基于语义相似性和反向索引的集合检索方案和父文档分段,提高检索阶段的文档检索准确性。其次,采用教师引导的偏好优化技术对LLM进行微调,以增强其基于CVE数据集的生成能力。该框架不仅通过RAG提升内容检索质量,还利用偏好微调在LLM中的优势,使回答更有效、更精确。实验表明,我们的方法在检索最新CVE方面准确率高于外部知识库。在结论方面,本框架显著缓解了仅依赖LLM进行知识检索时可能产生的潜在知识冲突和不一致性。

关键词

引用

@article{arxiv.2604.14172,
  title  = {Tug-of-War within A Decade: Conflict Resolution in Vulnerability Analysis via Teacher-Guided Retrieval-Augmented Generations},
  author = {Ziyin Zhou and Jianyi Zhang and Xu ji and Yilong Li and Jiameng Han and Zhangchi Zhao},
  journal= {arXiv preprint arXiv:2604.14172},
  year   = {2026}
}