中文

对检索而言,部分注意力机制已足够

机器学习 2025-10-24 v1

摘要

我们在混合 SSM-Transformer 架构中展示了完全的功能分离:检索能力完全依赖于自注意力层。在 RecurrentGemma-2B/9B 和 Jamba-Mini-1.6 上,注意力消融会导致灾难性的检索失败(准确率 0\%),而 SSM 层即使在改进提示的情况下也未表现出任何补偿机制。相反,将注意力稀疏化至仅保留 15\% 的注意力头,仍能保持近乎完美的检索能力,同时保留 84\% 的 MMLU 性能,这表明自注意力主要专门服务于检索任务。我们识别出检索的精确机制要求:在生成过程中必须暴露"针"token,且在预填充(prefill)或生成过程中必须提供足够的上下文。这种严格的功能专门化挑战了关于混合架构冗余性的假设,并表明这些模型更像是作为专门化模块而非集成系统运行,对架构优化与可解释性具有直接意义。

关键词

引用

@article{arxiv.2510.19861,
  title  = {Some Attention is All You Need for Retrieval},
  author = {Felix Michalak and Steven Abreu},
  journal= {arXiv preprint arXiv:2510.19861},
  year   = {2025}
}

备注

16 pages, 10 figures