领袖操作 (LBOps) 的工作流程与气味:面向基础模型排行榜的探索性研究
软件工程
2025-01-30 v4 机器学习
摘要
基础模型 (FM),如大型语言模型 (LLM),是大规模机器学习 (ML) 模型,已在各种下游软件工程 (SE) 任务中展现出惊人的适应性,如代码补全、代码理解和软件开发。因此,FM排行榜已成为SE团队比较和选择最佳第三方FM以满足其具体产品和目的的重要工具。然而,缺乏针对FM评估和比较的标准化指南会威胁FM排行榜的透明度,并限制利益相关者执行有效FM选择的能力。为此,我们首次聚焦于这些FM排行榜在实际场景中的运行方式(即"排行榜操作"),并识别潜在的陷阱和改进领域(即"排行榜气味")。在此基础上,我们从五个不同来源收集了最高1,045个FM排行榜:GitHub、Hugging Face Spaces、Papers With Code、电子表格和独立平台,以审查其文档并与排行榜操作者进行直接沟通,以了解其工作流程。通过卡片排序和协商一致,我们识别出五种不同的工作流程模式,并构建了一个捕获这些工作流程中关键组件及其相互作用的领域模型。随后,我们识别出八种独特的排行榜气味类型。通过消除这些气味,SE团队可以改进当前LBOps实践中的透明度、问责制和协作,促进更健全和负责任的FM比较和选择生态系统。
引用
@article{arxiv.2407.04065,
title = {On the Workflows and Smells of Leaderboard Operations (LBOps): An Exploratory Study of Foundation Model Leaderboards},
author = {Zhimin Zhao and Abdul Ali Bangash and Filipe Roseiro Côgo and Bram Adams and Ahmed E. Hassan},
journal= {arXiv preprint arXiv:2407.04065},
year = {2025}
}
备注
Awesome Foundation Model Leaderboard List: https://github.com/SAILResearch/awesome-foundation-model-leaderboards; Foundation Model Leaderboard Search Toolkit: https://huggingface.co/spaces/zhiminy/awesome-foundation-model-leaderboard-search