基于大语言模型的车载对话系统自动事实基准测试
计算与语言
2025-04-03 v1 人工智能
机器学习
软件工程
摘要
车载对话系统承诺提升车辆用户体验。现代对话系统基于大语言模型(LLM),因此容易出现幻觉,即不准确、虚构且事实错误的信息。本文提出一种基于LLM的方法,用于车载对话系统的自动事实基准测试。我们以五种LLM方法实现了该方法,利用集成技术和多样化persona来增强一致性并最小化幻觉。我们的方法用于评估CarExpert——一种基于车辆手册的车载检索增强对话问答系统。我们创建了一个专为车载领域设计的新型数据集,并将方法与专家评估进行了比较。我们的结果表明,GPT-4与输入输出提示结合可实现超过90%的事实正确性一致性,除了最高效的方法,平均响应时间为4.5秒。我们的发现表明,LLM基于测试是验证对话系统事实正确性的可行方法。
引用
@article{arxiv.2504.01248,
title = {Automated Factual Benchmarking for In-Car Conversational Systems using Large Language Models},
author = {Rafael Giebisch and Ken E. Friedl and Lev Sorokin and Andrea Stocco},
journal= {arXiv preprint arXiv:2504.01248},
year = {2025}
}
备注
Accepted in IEEE Intelligent Vehicles Symposium Conference (IV 2025)