对检索而言,部分注意力机制已足够
机器学习
2025-10-24 v1
摘要
我们在混合 SSM-Transformer 架构中展示了完全的功能分离:检索能力完全依赖于自注意力层。在 RecurrentGemma-2B/9B 和 Jamba-Mini-1.6 上,注意力消融会导致灾难性的检索失败(准确率 0\%),而 SSM 层即使在改进提示的情况下也未表现出任何补偿机制。相反,将注意力稀疏化至仅保留 15\% 的注意力头,仍能保持近乎完美的检索能力,同时保留 84\% 的 MMLU 性能,这表明自注意力主要专门服务于检索任务。我们识别出检索的精确机制要求:在生成过程中必须暴露"针"token,且在预填充(prefill)或生成过程中必须提供足够的上下文。这种严格的功能专门化挑战了关于混合架构冗余性的假设,并表明这些模型更像是作为专门化模块而非集成系统运行,对架构优化与可解释性具有直接意义。
引用
@article{arxiv.2510.19861,
title = {Some Attention is All You Need for Retrieval},
author = {Felix Michalak and Steven Abreu},
journal= {arXiv preprint arXiv:2510.19861},
year = {2025}
}
备注
16 pages, 10 figures