Lion 与 AdamW 优化器在跨编码器重排序中的比较分析:基于 MiniLM、GTE 与 ModernBERT
信息检索
2025-06-24 v1
摘要
现代信息检索系统通常采用两阶段流程:高效的最初检索阶段 followed by 计算密集型的重排序阶段。跨编码器在由于对查询-文档对进行深度分析方面显示出强大的重排序效果。本文研究了 Lion 优化器——一种最新的 AdamW 替代方案——在跨编码器重排序器微调过程中的影响。我们在 MS MARCO passage 排序数据集上使用两种优化器对三个变换模型进行微调:MiniLM、GTE 和 ModernBERT。GTE 和 ModernBERT 支持扩展上下文长度(最高达 8192 token)。我们使用 TREC 2019 深度学习轨道和 MS MARCO dev 集(MRR@10)进行有效性评估。在 Modal 云平台上的实验结果表明,ModernBERT 使用 Lion 在 TREC DL 2019 上实现最佳 NDCG@10(0.7225)和 MAP(0.5121),而 MiniLM 使用 Lion 在 MS MARCO dev 上与 ModernBERT 在 MRR@10(0.5988)上取得一致成绩。Lion 还在 GPU 效率方面表现优异,跨模型提升 2.67%至 10.33%。我们使用标准 IR 指标分析了性能趋势,并讨论了该优化器在不同架构中的训练动态影响。
关键词
引用
@article{arxiv.2506.18297,
title = {Comparative Analysis of Lion and AdamW Optimizers for Cross-Encoder Reranking with MiniLM, GTE, and ModernBERT},
author = {Shahil Kumar and Manu Pande and Anay Yatin Damle},
journal= {arXiv preprint arXiv:2506.18297},
year = {2025}
}