中文

基于大语言模型的车载对话系统自动事实基准测试

计算与语言 2025-04-03 v1 人工智能 机器学习 软件工程

摘要

车载对话系统承诺提升车辆用户体验。现代对话系统基于大语言模型(LLM),因此容易出现幻觉,即不准确、虚构且事实错误的信息。本文提出一种基于LLM的方法,用于车载对话系统的自动事实基准测试。我们以五种LLM方法实现了该方法,利用集成技术和多样化persona来增强一致性并最小化幻觉。我们的方法用于评估CarExpert——一种基于车辆手册的车载检索增强对话问答系统。我们创建了一个专为车载领域设计的新型数据集,并将方法与专家评估进行了比较。我们的结果表明,GPT-4与输入输出提示结合可实现超过90%的事实正确性一致性,除了最高效的方法,平均响应时间为4.5秒。我们的发现表明,LLM基于测试是验证对话系统事实正确性的可行方法。

关键词

引用

@article{arxiv.2504.01248,
  title  = {Automated Factual Benchmarking for In-Car Conversational Systems using Large Language Models},
  author = {Rafael Giebisch and Ken E. Friedl and Lev Sorokin and Andrea Stocco},
  journal= {arXiv preprint arXiv:2504.01248},
  year   = {2025}
}

备注

Accepted in IEEE Intelligent Vehicles Symposium Conference (IV 2025)