带推理的回忆:面向Mamba长上下文记忆与外推的思维链蒸馏
计算与语言
2025-06-04 v2
摘要
当序列长度远超训练长度时,Mamba 理论上的无限上下文潜力在实践中受到限制。本工作探索了一种简单而有效的方法——带推理的回忆(Recall with Reasoning, RwR),通过从教师模型蒸馏思维链(Chain-of-Thought, CoT)摘要来解锁 Mamba 的长上下文记忆能力。具体而言,RwR 在微调期间将这些摘要作为思维链提示前置,教导 Mamba 主动回忆和推理长上下文。在 LONGMEMEVAL 和 HELMET 上的实验表明,在相似的预训练条件下,RwR 提升了 Mamba 的长上下文性能,优于可比的 Transformer/混合基线模型,同时保留了短上下文能力,这一切都无需改变架构。
引用
@article{arxiv.2505.03320,
title = {Recall with Reasoning: Chain-of-Thought Distillation for Mamba's Long-Context Memory and Extrapolation},
author = {Junyu Ma and Tianqing Fang and Zhisong Zhang and Hongming Zhang and Haitao Mi and Dong Yu},
journal= {arXiv preprint arXiv:2505.03320},
year = {2025}
}