中文

镜中镜——哪个是最好的模型?

计算与语言 2025-12-03 v1

摘要

大型语言模型(LLM)已成为许多应用中最具变革性的工具之一,显著提升了生产力,在金融、医疗、教育、电信、法律等多个领域取得了令人印象深刻的成果。通常,面向特定用例或任务的领域适应模型是由大型企业在大型数据集合和大量计算和财务资源预训练后开发的基础模型。这些基础模型随后作为进一步开发和特定用例适应的基础。然而,鉴于发布新型基础模型的动态和快速变化的本质,选择最适合特定用例、应用程序或领域的模型变得日益复杂。我们认为,在为进一步训练选择模型时,需要考虑两个主要维度:一个是定性维度(基于信息,例如从模型卡中获取的哪个模型最适合某个任务),一个是定量维度(哪个模型性能最佳)。通过仪表盘评估模型的定量性能,这些仪表盘基于标准化基准对模型进行排序,并为比较不同 LLM 提供一致的框架。在本工作中,我们通过探索当前的仪表盘和基准来解决定量维度的问题。为了说明这一分析,我们聚焦于医疗领域作为案例研究,展示了该定量评估维度的演变、当前格局和实际意义。最后,我们提出了一种模型选择方法论(MSM),旨在引导导航、优先排序和选择最符合给定用例的模型。

关键词

引用

@article{arxiv.2512.02043,
  title  = {Mirror, Mirror on the Wall -- Which is the Best Model of Them All?},
  author = {Dina Sayed and Heiko Schuldt},
  journal= {arXiv preprint arXiv:2512.02043},
  year   = {2025}
}