中文

检索增强生成中的数据质量挑战

人工智能 2025-10-02 v1 人机交互

摘要

组织越来越多地采用检索增强生成(RAG)来增强大型语言模型(LLM)以整合企业特定知识。然而,当前的数据质量(DQ)框架主要是为静态数据集开发的,且仅不充分地解决 RAG 系统的动态、多阶段本质。本研究旨在为这种新的 AI 系统开发 DQ 维度。我们对领先 IT 服务公司的从业者进行了 16 项半结构化访谈。通过定性内容分析,我们归纳出 15 个不同的 DQ 维度,覆盖 RAG 系统的四个处理阶段:数据提取、数据转换、提示与搜索以及生成。我们的发现表明:(1)必须添加新的维度到传统 DQ 框架,以覆盖 RAG 上下文;(2)这些新的维度集中在 RAG 的早期步骤中,表明需要前置质量管理策略;(3)DQ 问题在 RAG 流程中转化并传播, necessitating a dynamic, step-aware 的质量管理方法。

关键词

引用

@article{arxiv.2510.00552,
  title  = {Data Quality Challenges in Retrieval-Augmented Generation},
  author = {Leopold Müller and Joshua Holstein and Sarah Bause and Gerhard Satzger and Niklas Kühl},
  journal= {arXiv preprint arXiv:2510.00552},
  year   = {2025}
}

备注

Preprint version. Accepted for presentation at the International Conference on Information Systems (ICIS 2025). Please cite the published version when available