评估基础模型效能:推进细调决策的基准测试实践
计算与语言
2024-08-22 v2 人工智能
机器学习
性能
摘要
最近,大型语言模型(LLM)已扩展到多个领域。然而,仍需评估这些模型在常规查询与特定领域查询上的表现,这对于在细调特定下游任务前进行基准测试具有重要意义。本研究评估了 Gemma-2B 和 Gemma-7B 等 LLM 在包括网络安全、医疗和金融等多种领域,针对常规知识查询进行的表现。该研究采用全面的方法论评估基础模型,包括问题表述、数据分析和开发 ThroughCut——一种新型异常检测技术,通过响应简洁性自动识别响应吞吐量异常值。这种方法论严谨性增强了所提出评估框架的可信度。本研究聚焦评估推理时间、响应长度、吞吐量、质量和资源利用,并探讨了这些因素之间的相关性。结果表明,模型规模和推理时使用的提示类型显著影响响应长度和质量。此外,常规提示(包括各种查询类型)会在不规则间隔内生成多样且不一致的响应;而相比之下,特定领域的提示始终在合理时间内生成简洁的响应。总体而言,本研究凸显了需要全面评估框架以提升多域 AI 研究中基准测试程序可靠性的必要性。
引用
@article{arxiv.2407.11006,
title = {Evaluating the Efficacy of Foundational Models: Advancing Benchmarking Practices to Enhance Fine-Tuning Decision-Making},
author = {Oluyemi Enoch Amujo and Shanchieh Jay Yang},
journal= {arXiv preprint arXiv:2407.11006},
year = {2024}
}
备注
10 pages, 5 figures, 2 tables, and algorithms