中文

模型中心及其之外:分析模型流行度、性能和文档

计算与语言 2025-04-08 v2

摘要

随着 Hugging Face 等平台上机器学习模型的激增,用户经常迷失方向,难以为其下游任务选择最佳模型,通常依赖下载量、点赞数或新颖性等模型流行度指标。我们调查了这种流行度是否与实际模型性能一致,以及模型文档的全面性如何与流行度和性能相关联。在我们的研究中,我们评估了 Hugging Face 上全面的 500 个情感分析模型。该评估涉及大量标注工作,人类标注者完成了近 80,000 次标注,以及广泛的模型训练和评估。我们的结果表明,模型流行度不一定与性能相关。此外,我们识别出模型卡报告中的关键不一致性:约 80% 的分析模型缺乏关于模型、训练和评估过程的详细信息。此外,约 88% 的模型作者在模型卡中夸大了其模型的性能。基于我们的结果,我们为用户提供了一套选择良好下游任务模型的检查清单指南。

关键词

引用

@article{arxiv.2503.15222,
  title  = {Model Hubs and Beyond: Analyzing Model Popularity, Performance, and Documentation},
  author = {Pritam Kadasi and Sriman Reddy Kondam and Srivathsa Vamsi Chaturvedula and Rudranshu Sen and Agnish Saha and Soumavo Sikdar and Sayani Sarkar and Suhani Mittal and Rohit Jindal and Mayank Singh},
  journal= {arXiv preprint arXiv:2503.15222},
  year   = {2025}
}

备注

Accepted to ICWSM'25