中文

用于 RAG 评估的多样化且隐私保护的合成数据集生成:一种多智能体框架

计算与语言 2025-08-27 v1 人工智能

摘要

检索增强生成(RAG)系统通过整合外部知识来改进大语言模型的输出,从而能够做出更明智且上下文感知的响应。然而,这些系统的有效性和可信度关键取决于如何对其进行评估,特别是评估过程是否捕捉到了现实世界的约束条件,如保护敏感信息。尽管当前 RAG 系统的评估工作主要集中在性能指标的发展上,但对底层评估数据集的设计和质量关注甚少,尽管它们对于实现有意义、可靠的评估至关重要。在这项工作中,我们引入了一种新颖的多智能体框架,用于生成优先考虑语义多样性和隐私保护的合成问答数据集,以用于 RAG 评估。我们的方法包括:(1)一个多样性智能体,利用聚类技术最大化主题覆盖和语义变异性;(2)一个隐私智能体,检测并掩盖多个领域的敏感信息;(3)一个问答管理智能体,合成适合作为 RAG 评估基准的隐私且多样化的问答对。大量实验表明,我们的评估集在多样性方面优于基线方法,并在特定领域数据集上实现了稳健的隐私掩盖。这项工作为更安全、更全面的 RAG 系统评估提供了一条实用且符合伦理的途径,为未来与不断发展的 AI 法规和合规标准相一致的增强功能奠定了基础。

关键词

引用

@article{arxiv.2508.18929,
  title  = {Diverse And Private Synthetic Datasets Generation for RAG evaluation: A multi-agent framework},
  author = {Ilias Driouich and Hongliu Cao and Eoin Thomas},
  journal= {arXiv preprint arXiv:2508.18929},
  year   = {2025}
}

备注

ECAI 2025 TRUST AI workshop