中文

MeTMaP:用于检测 LLM 增强生成中虚假向量匹配问题的 metamorphic testing

软件工程 2024-02-23 v1

摘要

检索增强生成 (RAG) 和缓存增强生成 (CAG) 等增强生成技术通过利用外部知识和缓存信息来提升大语言模型 (LLM) 的输出,从而彻底改变了该领域。然而,作为这些增强技术骨干的向量数据库的引入带来了关键挑战,特别是在确保准确的向量匹配方面。这些数据库中的虚假向量匹配会严重损害 LLM 输出的完整性和可靠性,导致误导信息或错误响应。尽管这些问题影响重大,但在有效检测和解决 LLM 增强生成中虚假向量匹配的方法方面仍存在显著的研究空白。本文提出了 MeTMaP,一种旨在识别 LLM 增强生成系统中虚假向量匹配的 metamorphic testing 框架。我们从六个 NLP 数据集中推导出八个 metamorphic relations (MRs),构成了我们方法的核心,其基本理念是语义相似的文本应当匹配,而语义不相似的文本不应匹配。MeTMaP 利用这些 MRs 创建用于测试的句子三元组,以模拟真实的 LLM 场景。我们在涉及 29 个嵌入模型和 7 种距离度量的 203 种向量匹配配置上对 MeTMaP 进行了评估,发现了显著的 inaccuracies。结果显示,在我们的测试中最高准确率仅为 41.51\%(相较于原始数据集),这强调了向量匹配方法中虚假匹配问题的普遍性,以及在 LLM 增强应用中进行有效检测和缓解的迫切需求。

关键词

引用

@article{arxiv.2402.14480,
  title  = {MeTMaP: Metamorphic Testing for Detecting False Vector Matching Problems in LLM Augmented Generation},
  author = {Guanyu Wang and Yuekang Li and Yi Liu and Gelei Deng and Tianlin Li and Guosheng Xu and Yang Liu and Haoyu Wang and Kailong Wang},
  journal= {arXiv preprint arXiv:2402.14480},
  year   = {2024}
}