中文

精调是否成功?解构大型语言模型中的性能神话

计算与语言 2024-07-02 v2 人工智能

摘要

大型语言模型(LLM)具有独特的能力,能够理解和生成类似人类的文本以响应输入查询。当进行精调时,这些模型在特定领域查询方面显示出增强的性能。OpenAI强调了精调的过程,指出:“要精调模型,需提供至少10个示例。我们通常在50至100个训练示例上看到明显的改进,但正确的数量很大程度上取决于具体用例。”本研究将这一概念扩展到LLM集成于检索增强生成(RAG)管道中,以通过利用外部语料库数据进行信息检索来提高准确性和相关性。然而,RAG为实现最佳响应的承诺在复杂查询情景中往往难以实现。本研究旨在特别检查在RAG系统中对LLM提取和集成上下文数据能力的影响,以提高多个领域中RAG性能。我们通过比较在多个领域的数据集上进行精调的LLM与基线性能之间的准确性和完整性来评估精调对LLM数据提取和上下文理解能力的影响。我们的发现表明,尽管OpenAI在独立LLM应用中观察到的改进表明精调导致了性能下降,相对于基线模型。本研究突显了在特定领域任务中对精调模型进行激烈的调查和验证的必要性。

关键词

引用

@article{arxiv.2406.11201,
  title  = {Fine-Tuning or Fine-Failing? Debunking Performance Myths in Large Language Models},
  author = {Scott Barnett and Zac Brannelly and Stefanus Kurniawan and Sheng Wong},
  journal= {arXiv preprint arXiv:2406.11201},
  year   = {2024}
}

备注

8 pages, 4 figures