中文

通过逆值学习实现可迁移的后训练

机器学习 2025-06-16 v2 计算与语言

摘要

随着后训练过程使用的数据集越来越大,基础模型的规模也在持续增长,现有算法的计算需求和实现挑战正显著增加。在本文中,我们提出使用一个独立的神经网络(即值网络)来建模后训练过程中 logits 层面的变化。在利用示范数据于一个小型基础模型上训练该网络后,该网络可以在推理时无缝集成到其他预训练模型中,使其获得类似的能力提升。我们系统地研究了该范式在预训练权重和连接方案方面的最佳实践。我们证明,所得的值网络在以下方面具有广泛的迁移性:同一系列中不同参数规模的预训练模型之间、同一系列内持续预训练的模型之间,以及跨系列具有不同词表的模型之间。在某些情况下,其性能可与全参数微调相媲美。此外,我们探索了增强值模型迁移性并防止其过拟合于训练时所使用的基础模型的方法。

关键词

引用

@article{arxiv.2410.21027,
  title  = {Transferable Post-training via Inverse Value Learning},
  author = {Xinyu Lu and Xueru Wen and Yaojie Lu and Bowen Yu and Hongyu Lin and Haiyang Yu and Le Sun and Xianpei Han and Yongbin Li},
  journal= {arXiv preprint arXiv:2410.21027},
  year   = {2025}
}

备注

NAACL 2025 Camera Ready