评估ChatGPT在核领域专有数据上的表现
计算与语言
2024-09-04 v1 人工智能
摘要
本文检验了大语言模型(LLM)ChatGPT 在核数据领域的问答任务中的应用。主要焦点是评估 ChatGPT 在精选测试数据集上的表现,比较独立运行的 LLM 与通过检索增强生成(RAG)方法生成的输出结果。尽管 LLM 最近取得了进展,但仍容易生成错误或‘幻觉’信息,这在需要高准确率和可靠性的应用中是重要的局限性。本研究探讨了利用 RAG 在 LLM 中集成外部知识库和高级检索技术以提升输出准确性和相关性的潜力。在此背景下,本文评估了 ChatGPT 解答 domain-specific questions 的能力,采用两种方法:A)直接来自 LLM 的响应,B)在 RAG 框架内的 LLM 响应。通过双重机制(人类评估和 LLM 评估)对响应进行正确性和其他指标的评分。研究结果凸显了在 LLM 中集成 RAG 流程后,尤其是在生成针对核领域专有查询更准确、更恰当的上下文响应方面的性能提升。此外,本文还概述了进一步细化和改善此类专业领域答案质量的替代方法。
引用
@article{arxiv.2409.00090,
title = {Evaluating ChatGPT on Nuclear Domain-Specific Data},
author = {Muhammad Anwar and Mischa de Costa and Issam Hammad and Daniel Lau},
journal= {arXiv preprint arXiv:2409.00090},
year = {2024}
}