中文

基于知识图谱的大型语言模型一致性测试

计算与语言 2025-08-15 v3 人工智能 机器学习

摘要

本工作系统性地暴露和衡量大型语言模型(LLM)的不一致性和知识缺口。具体我们提出了一个自动化测试框架(称为 KonTest),利用知识图谱构建测试用例。KonTest 通过结合语义等价查询和测试宰俄( metamorphic oracle)或本体学宰俄(ontological oracle)来探测和衡量 LLM 对世界知识的不一致性。KonTest 还通过加权 LLM 模型集成来缓解知识缺口。使用四个最先进的 LLM(Falcon、Gemini、GPT3.5 和 Llama2),我们显示 KonTest 生成 19.2% 的诱导错误输入(从 9979 个测试输入中产生 1917 个错误)。它还揭示了所有测试中 LLM 之间存在 16.5% 的知识缺口。由 KonTest 测试套组 informing 的缓解方法可将 LLM 知识缺口降低 32.48%。我们的消融研究进一步表明,GPT3.5 不适合基于知识的一致性测试,因为其在知识构建方面仅有效 60% 至 68%。

关键词

引用

@article{arxiv.2407.12830,
  title  = {Knowledge-based Consistency Testing of Large Language Models},
  author = {Sai Sathiesh Rajan and Ezekiel Soremekun and Sudipta Chattopadhyay},
  journal= {arXiv preprint arXiv:2407.12830},
  year   = {2025}
}

备注

12 pages, 4 figures, 8 tables, Accepted at EMNLP 2024 Findings