中文

BehaviorBox:语言模型间细粒度性能差异的自动发现

计算与语言 2025-06-11 v2

摘要

语言模型评估是一项艰巨的任务:提示词脆弱易变,语料库级别的困惑度模糊不清,且基准测试的选择无穷无尽。寻找能体现两个语言模型 (LM) 之间有意义且具泛化性差异的示例,对于理解一个模型在何处成功而另一个在何处失败至关重要。这一过程能否自动完成?在本工作中,我们提出了一种语言模型自动比较方法,该方法利用感知性能的上下文嵌入来寻找文本的细粒度特征,使得某一LM在生成难易度上优于另一LM。我们将我们的方法命名为BehaviorBox,它提取连贯的特征,以展示两个LM之间在生成难易度方面的差异。具体而言,BehaviorBox寻找描述细粒度上下文中词组的特征,例如“短语‘if you were’中的条件式‘were’”和“情感陈述后的感叹号”,在这些特征下,某一模型在特定数据集内优于另一模型。我们应用BehaviorBox比较了在规模、模型系列和训练后阶段上存在差异的模型,并列举了关于特定上下文的见解,这些上下文说明了仅靠语料库级别的困惑度等指标无法发现的有意义的性能差异。

关键词

引用

@article{arxiv.2506.02204,
  title  = {BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models},
  author = {Lindia Tjuatja and Graham Neubig},
  journal= {arXiv preprint arXiv:2506.02204},
  year   = {2025}
}

备注

Accepted to ACL 2025 Main Conference