中文

面向工业问答应用的 RAG 与微调评估

计算与语言 2026-05-12 v1 人工智能

摘要

大型语言模型(LLM)正日益应用于企业问答(QA)系统中,这需要适应特定领域的知识。引入此类知识最普遍的方法包括检索增强生成(RAG)和微调(FT)。然而,从成本-准确性的权衡角度来看,目前尚不清楚哪种方法最适合工业场景。本研究考察了 RAG 和 FT 对汽车行业特有的两个闭源数据集的影响,评估了回答质量和运营成本。我们扩展了 Erol 等人(arXiv:2504.13359)提出的 Cost-of-Pass 框架,以联合评估输出质量、生成成本和用户交互成本。我们的研究结果表明,虽然高级模型开箱即用时表现最佳,但开源模型在通过 RAG 增强后能够达到可比的质量。总体而言,RAG 是闭源和开源模型中最有效且最具成本效益的适配方法。

关键词

引用

@article{arxiv.2605.09533,
  title  = {Assessment of RAG and Fine-Tuning for Industrial Question-Answering-Applications},
  author = {Jakob Sturm and Josef Pichlmeier and Christian Bernhard and Maka Karalashvili and Johannes Klepsch and Georg Groh and Andre Luckow},
  journal= {arXiv preprint arXiv:2605.09533},
  year   = {2026}
}

备注

Accepted at AAAI 2026 Workshop on New Frontiers in Information Retrieval