中文

LLM-RAG 系统质量保证:来自旅游应用测试的实证洞见

软件工程 2025-02-11 v1

摘要

本文提出了一套全面的框架,用于测试和评估增强型检索生成(RAG)的大型语言模型(LLM)系统在旅游应用中的质量特征。通过对三种不同 LLM 变体在多个参数配置下的系统性实证评估,我们展示了测试方法在评估功能正确性和非功能属性方面的有效性。我们的框架实现了 17 项不同的指标,涵盖语法分析、语义评估和通过 LLM 评判器进行的行为评估。研究结果揭示了不同架构选择和参数配置如何影响系统性能,尤其强调了温度和 top-p 参数对响应质量的显著影响。测试在为维尔曼德地区旅游推荐系统中进行,采用标准和 RAG 增强配置。结果表明,较新的 LLM 版本在性能指标上显示出有限的改进,尽管在响应长度和复杂度方面的差异更为显著,而非语义质量。该研究为在 LLM-RAG 系统中实施稳健的测试实践提供了实用见解,为在生产环境中部署此类架构的组织提供了宝贵指导。

关键词

引用

@article{arxiv.2502.05782,
  title  = {Quality Assurance for LLM-RAG Systems: Empirical Insights from Tourism Application Testing},
  author = {Bestoun S. Ahmed and Ludwig Otto Baader and Firas Bayram and Siri Jagstedt and Peter Magnusson},
  journal= {arXiv preprint arXiv:2502.05782},
  year   = {2025}
}

备注

10 pages