中文

TRAM:连接信任域与锐度感知最小化

机器学习 2024-03-13 v2 计算与语言

摘要

锐度感知最小化 (SAM) 通过降低参数空间中损失曲面曲率来提升域泛化。然而,微调过程中的泛化往往更依赖于函数空间中表征的可迁移性。信任域方法 (TR) 通过正则化表征曲率以减小对预训练任务无关信息的灾难性遗忘,同时采纳任务特定技能,来实现这一目标。我们考虑统一这些策略,以在参数空间与函数空间中均获得低曲率,从而改善域外 (OOD) 泛化。我们提出信任域感知最小化 (TRAM),一种 SAM 微调算法,兼顾低参数锐度与平滑、信息丰富的表征,以保留预训练结构。TRAM 利用信任域界来界定 SAM 对抗邻域,在追求更平坦极小值的优化中引入函数曲率的感知。我们在视觉(跨数据集适配)与文本(OOD 语言建模、零样本跨语言迁移)任务上实证验证了 TRAM,这些任务中鲁棒的域迁移与表征通用性至关重要。TRAM 在所有任务上均优于基于 SAM 和 TR 的优化,尤其在反相关域间的困难迁移上显著超越竞争方法。TRAM 以相较以往锐度感知方法极小的额外计算,为域可泛化模型的微调建立了新标准。

关键词

引用

@article{arxiv.2310.03646,
  title  = {TRAM: Bridging Trust Regions and Sharpness Aware Minimization},
  author = {Tom Sherborne and Naomi Saphra and Pradeep Dasigi and Hao Peng},
  journal= {arXiv preprint arXiv:2310.03646},
  year   = {2024}
}

备注

Camera Ready for ICLR 2024 (Accepted as Spotlight). 21 pages, 14 tables, 2 figures