中文

简单的 LLM 基线在模型对比中同样具有竞争力

机器学习 2026-02-12 v1

摘要

标准的 LLM 评估仅测试评估者设计的能力或倾向,遗漏了例如模型修订之间的行为变化或新出现的不一致倾向等意外差异。模型对比通过自动揭示系统性行为差异来解决这一限制。最近的做法包括基于 LLM 的方法生成自然语言描述,以及基于稀疏自编码器(SAE)的方法识别可解释特征。然而,目前尚无这些方法的系统性比较,也没有建立的评估标准。我们通过提出关键需求(泛化性、有趣性和抽象程度)的评估指标来弥补这一空白,并使用这些指标对现有方法进行比较。我们的结果表明,改进的基于 LLM 的基线在通常揭示更抽象行为差异方面,与基于 SAE 的方法相当。

关键词

引用

@article{arxiv.2602.10371,
  title  = {Simple LLM Baselines are Competitive for Model Diffing},
  author = {Elias Kempf and Simon Schrodi and Bartosz Cywiński and Thomas Brox and Neel Nanda and Arthur Conmy},
  journal= {arXiv preprint arXiv:2602.10371},
  year   = {2026}
}