超越排行榜:通过模型差分理解大语言模型的性能差异
计算与语言
2025-09-24 v1
摘要
随着微调成为提升大语言模型(LLMs)的主流范式,理解该过程中发生的变化日益重要。传统的基准测试往往无法解释为何一个模型优于另一个模型。在本工作中,我们使用模型差分(一种机制可解释性方法)来分析 Gemma-2-9b-it 与其 SimPO 增强变体之间的具体能力差异。利用交叉编码器,我们识别并分类了区分这两个模型的潜在表示。我们发现,SimPO 习得的潜在概念主要增强了安全机制(+32.8%)、多语言能力(+43.8%)和指令遵循能力(+151.7%),而其额外训练也降低了对模型自引用(-44.1%)和幻觉管理(-68.5%)的侧重。我们的分析表明,模型差分能够提供超越排行榜指标的细粒度洞察,将性能差距归因于具体的机制能力。该方法为比较 LLMs 提供了一个透明且有针对性的框架。
引用
@article{arxiv.2509.18792,
title = {Beyond the Leaderboard: Understanding Performance Disparities in Large Language Models via Model Diffing},
author = {Sabri Boughorbel and Fahim Dalvi and Nadir Durrani and Majd Hawasly},
journal= {arXiv preprint arXiv:2509.18792},
year = {2025}
}
备注
12 pages, accepted to the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)