线性连通性揭示泛化策略
机器学习
2023-01-24 v5 计算与语言
摘要
在模式连通性文献中,广泛认为当两个神经网络在同一数据上以相似方式训练时,它们由参数空间中一条保持测试集精度的路径相连。在某些情况下(包括基于预训练模型的迁移学习),这些路径被认为是线性的。与已有结果相反,我们发现文本分类器(在MNLI、QQP和CoLA上训练)中,一些微调模型对在其间的线性路径上存在损失增大的巨大屏障。在每个任务上,我们发现不同的模型簇在测试损失曲面上是线性连通的,但与簇外模型不连通——这些模型占据曲面上独立的 basin。通过在与领域偏移下特别设计的诊断数据集上测量性能,我们发现这些簇对应于不同的泛化策略:一个簇在领域偏移下表现为词袋模型,而另一个簇使用句法启发式。我们的工作展示了损失曲面的几何如何引导模型走向不同的启发式函数。
引用
@article{arxiv.2205.12411,
title = {Linear Connectivity Reveals Generalization Strategies},
author = {Jeevesh Juneja and Rachit Bansal and Kyunghyun Cho and João Sedoc and Naomi Saphra},
journal= {arXiv preprint arXiv:2205.12411},
year = {2023}
}
备注
Publushed as a conference paper at ICLR 2023