评估机场领域对话式AI的RAG方法性能
计算与语言
2025-05-20 v1
摘要
以年度乘客数排名前20的机场是高度动态的环境,每天有数千次航班,旨在提高自动化程度。为此,我们实现了一个对话式AI系统,使机场工作人员能够与航班信息系统进行沟通。该系统不仅回答标准机场查询,还能解决机场术语、行话、缩写以及涉及推理的动态问题。在本文中,我们构建了三种不同的检索增强生成(RAG)方法,包括传统RAG、SQL RAG和基于知识图谱的RAG(Graph RAG)。实验显示,传统RAG使用BM25 + GPT-4达到84.84%的准确率,但偶尔会产生幻觉,这在机场安全方面风险较大。相比之下,SQL RAG和Graph RAG分别达到80.85%和91.49%的准确率,幻觉显著减少。此外,Graph RAG特别适用于涉及推理的问题。基于我们的观察,我们因此建议在机场环境中使用SQL RAG和Graph RAG,因为它们幻觉更少且能处理动态问题。
引用
@article{arxiv.2505.13006,
title = {Evaluating the Performance of RAG Methods for Conversational AI in the Airport Domain},
author = {Yuyang Li and Philip J. M. Kerbusch and Raimon H. R. Pruim and Tobias Käfer},
journal= {arXiv preprint arXiv:2505.13006},
year = {2025}
}
备注
Accepted by NAACL 2025 industry track