FineTuneBench:商业微调API在向LLM注入知识方面的表现如何?
计算与语言
2024-11-13 v2 人工智能
信息检索
摘要
将前沿大语言模型(LLM)进行微调以注入新信息和更新已有知识备受关注。尽管OpenAI和Google等提供商的商业LLM微调API承诺能为各种应用提供灵活适配,但微调的实际效果尚不明确。在本研究中,我们引入了FineTuneBench——一个用于评估商业微调API在成功学习新知识和更新知识方面表现的评估框架和数据集。我们使用商业可用的微调API分析了五款前沿LLM(包括GPT-4o和Gemini 1.5 Pro)在两种设置下的有效性:(1)摄取新信息,如近期新闻事件和新人物档案;(2)更新已有知识,如更新的医疗指南和代码框架。我们的结果揭示了所有模型通过微调有效学习新信息的能力存在显著不足,所有模型的平均泛化准确率仅为37%。在更新已有知识(如纳入医疗指南更新)方面,商业微调API表现出更加有限的能力(平均泛化准确率仅为19%)。总体而言,微调GPT-4o mini在注入新知识和更新知识方面最为有效,其次是GPT-3.5 Turbo和GPT-4o。Gemini 1.5 Flesh和Gemini 1.5 Pro的微调API无法学习新知识或更新已有知识。这些发现凸显了当前商业微调服务在常见场景下实现可靠知识注入的重大缺陷。我们在https://github.com/kevinwu23/StanfordFineTuneBench上开源了FineTuneBench数据集。
引用
@article{arxiv.2411.05059,
title = {FineTuneBench: How well do commercial fine-tuning APIs infuse knowledge into LLMs?},
author = {Eric Wu and Kevin Wu and James Zou},
journal= {arXiv preprint arXiv:2411.05059},
year = {2024}
}