中文

何时思考快而慢?AMOR:基于自适应熵门的混合模型

人工智能 2026-05-14 v2

摘要

循环-注意力混合模型旨在结合 recurrence 的效率与 attention 的表达性,但现有方法通常在所有位置上均匀应用 attention,即使 recurrent 状态本身足以准确预测。我们引入 AMOR(Adaptive Metacognitive Output Router),一种后置混合架构,基于预测不确定性 selectively 调用 attention。一个 recurrent 主干网络增强了 entropy-gated attention blocks,仅在模型输出熵率于运行批量中位数和比例标准差缩放后的动态阈值之上时激活。这产生一种简单、无梯度的路由机制,灵感来自于不确定性驱动的计算和 System 1 / System 2 区分。AMOR 在 Mamba2 和 Gated DeltaNet 主干网络(1.8B 参数)上,始终匹配或优于纯循环模型和固定日程混合基线,仅在约 22% 的 token 上调用 attention。它在常见常识推理基准上取得好成绩,并在 LongBench 上保持稳定的长程文本性能,其中先前的混合模型在分布迁移下会退化。这些结果表明,注意力何时被应用与多少同样重要:基于预测不确定性有选择地分配注意力可提升效率和鲁棒性,为统一或固定路由策略提供了简单替代方案,并指向能动态匹配计算与输入难度的自适应混合架构。

关键词

引用

@article{arxiv.2602.13215,
  title  = {When to Think Fast and Slow? AMOR: Adaptive Entropy Gate for Hybrid Models},
  author = {Haoran Zheng and Chen Shani},
  journal= {arXiv preprint arXiv:2602.13215},
  year   = {2026}
}