中文

基于机器学习算法的 RAG 检索质量分析与评估预测

机器学习 2025-11-26 v1

摘要

随着大语言模型的快速发展,检索增强生成技术因其能够整合外部知识以提高输出准确性而得到广泛应用。然而,系统性能高度依赖于检索模块的质量。如果检索结果与用户需求相关性低或包含噪声信息,将直接导致生成内容的失真。针对现有模型在处理表格特征方面的性能瓶颈,本文提出了一种基于特征工程和粒子群优化的 XGBoost 机器学习回归模型。相关性分析表明,answer_quality 与 doc_relevance 呈正相关(0.66),表明文档相关性对答案质量有显著正向影响,提高文档相关性可能提升答案质量;语义相似性、冗余性和多样性之间的强负相关分别为 -0.89 和 -0.88,表明语义相似性、冗余性与多样性之间存在权衡关系。换句话说,随着前两者增加,多样性显著降低。与决策树、AdaBoost 等模型的实验结果比较表明,VMD PSO BiLSTM 模型在所有评估指标上均优于对比模型,MSE、RMSE、MAE 和 MAPE 显著更低,R² 值更高,表明其预测精度、稳定性和数据解释能力更为突出。该成果为优化检索质量和提升 RAG 系统生成效果提供了有效路径,对推动相关技术的实施与应用具有重要价值。

关键词

引用

@article{arxiv.2511.19481,
  title  = {Quality analysis and evaluation prediction of RAG retrieval based on machine learning algorithms},
  author = {Ruoxin Zhang and Zhizhao Wen and Chao Wang and Chenchen Tang and Puyang Xu and Yifan Jiang},
  journal= {arXiv preprint arXiv:2511.19481},
  year   = {2025}
}