中文

挖掘Hugging Face仓库的经验教训

软件工程 2024-02-13 v1 机器学习

摘要

机器学习(ML)和人工智能快速发展的领域见证了像Hugging Face (HF)这样的平台作为模型开发和共享的中心枢纽的出现。本经验报告综合了在HF上进行的两项综合研究的见解,重点关注碳排放以及ML模型的演化和维护方面。我们的目标是为未来在HF生态系统内开展挖掘软件仓库研究的科研人员提供一个实用指南,以提高这些研究的质量。我们深入探讨了研究中使用的可复现包(replication package)的复杂性,重点介绍了促进我们分析的关键工具和方法。此外,我们提出了一种针对多样化HF Hub数据集量身定制的细致分层抽样策略,确保了一种具有代表性和全面性的分析方法。本报告还引入了初步指南,从仓库挖掘过渡到队列研究,以在仓库挖掘研究中建立因果关系,特别是在HF的ML模型背景下。这一转变受到现有框架的启发,并经过调整以适应HF模型生态系统的独特特征。我们的报告为研究人员提供了一个指导框架,有助于ML的负责任和可持续发展,并促进对ML模型更广泛影响的更深入理解。

关键词

引用

@article{arxiv.2402.07323,
  title  = {Lessons Learned from Mining the Hugging Face Repository},
  author = {Joel Castaño and Silverio Martínez-Fernández and Xavier Franch},
  journal= {arXiv preprint arXiv:2402.07323},
  year   = {2024}
}

备注

Accepted at the 2024 ACM/IEEE 1st International Workshop on Methodological Issues with Empirical Studies in Software Engineering (WSESE)