状态空间模型是强大的文本重排序器
计算与语言
2025-04-23 v3 信息检索
摘要
Transformer在NLP和IR中占主导地位;但它们在推理上的低效以及外推到更长上下文的挑战激发了人们对替代模型架构的兴趣。其中,状态空间模型(SSM)如Mamba提供了有前景的优势,特别是在推理中具有O(1)时间复杂度。尽管有潜力,SSM在文本重排序任务(需要细粒度查询-文档交互和长上下文理解)中的有效性仍未得到充分探索。本研究将基于SSM的架构(特别是Mamba-1和Mamba-2)与基于Transformer的模型在各种规模、架构和预训练目标下进行基准测试,重点关注文本重排序任务中的性能和效率。我们发现:(1)Mamba架构实现了与类似大小的基于Transformer的模型相当的竞争性文本排序性能;(2)与具有flash attention的Transformer相比,它们在训练和推理中效率较低;(3)Mamba-2在性能和效率上都优于Mamba-1。这些结果强调了状态空间模型作为Transformer替代方案的潜力,并指出了未来IR应用中需要改进的领域。
引用
@article{arxiv.2412.14354,
title = {State Space Models are Strong Text Rerankers},
author = {Zhichao Xu and Jinghua Yan and Ashim Gupta and Vivek Srikumar},
journal= {arXiv preprint arXiv:2412.14354},
year = {2025}
}
备注
Accepted to RepL4NLP 2025. The first two authors contributed equally, order decided randomly