评估基于检索增强的生成模型在交通安全文件查询中的表现
计算与语言
2025-04-10 v1
摘要
生成式大型语言模型 LLM 的应用正在快速扩展到 various 领域,为工作流程效率和信息检索带来显著改进。然而,在危险物质运输等专门且高风险的领域实施其具有挑战性,因为 accuracy 和 reliability concerns。本研究评估了三种微调的生成模型,包括 ChatGPT、Google Vertex AI 以及 ORNL 检索增强生成 (RAG) 增强 LLaMA 2 和 LLaMA 在获取美国危险物质运输合规性信息方面的性能。我们使用约40个公开的联邦和州监管文件开发了100个与路线规划和许可要求相关的真实查询。对模型输出进行基于 accuracy、detail 和 relevance 的定性评分,并以语义相似性进行量化评估。结果表明,RAG 增强的 LLaMA 模型在准确性和 detail 方面显著优于 Vertex AI 和 ChatGPT,尽管偶有不一致。该研究引入了交通安全领域首个已知的 RAG 应用,强调了 domain-specific fine-tuning 和严格评估方法的重要性,以确保 reliability 并最小化高风险环境中的不准确性风险。
引用
@article{arxiv.2504.07022,
title = {Evaluating Retrieval Augmented Generative Models for Document Queries in Transportation Safety},
author = {Chad Melton and Alex Sorokine and Steve Peterson},
journal= {arXiv preprint arXiv:2504.07022},
year = {2025}
}
备注
14 pages, 3 Figures, 3 tables