降低推理成本:通过稀疏注意力机制优化思维链的路径
机器学习
2025-07-11 v8
摘要
为解决大语言模型推理中思维链导致的成本激增,本研究提出仅关注少数相关标记的稀疏注意力机制。研究者构建了一个新的注意力机制,并使用基于自定义GPT训练的GiantRabbit作为实验工具。实验测试并比较了该模型与o1 Preview在解决MIT公开课线性代数测试题时的推理时间、正确率得分和思维链长度。结果表明,GiantRabbit的推理时间和思维链长度显著低于o1 Preview。这验证了稀疏注意力机制优化思维链推理的可行性。详细的架构细节和实验过程已上传至Github,链接为:https://github.com/brucewang123456789/GeniusTrail.git。
引用
@article{arxiv.2411.09111,
title = {Reducing Reasoning Costs: The Path of Optimization for Chain of Thought via Sparse Attention Mechanism},
author = {Libo Wang},
journal= {arXiv preprint arXiv:2411.09111},
year = {2025}
}
备注
The relevant code and experimental results are publicly available in the GitHub repository link:https://github.com/brucewang123456789/GeniusTrail/tree/main/Sparse%20Attention%20Mechanism