CoTFormer:一种推理时具备预算自适应计算开销的思维链驱动架构
计算与语言
2024-08-16 v2 机器学习
摘要
将语言模型扩展至更大更深的规模带来了显著的性能提升。尽管这些模型的规模限制了它们在计算受限环境中的应用,但持续开发更大更深基础模型的竞赛仍在进行。与此同时——无论模型规模如何——任务专用技术始终在取得最优下游性能方面发挥着关键作用。其中一项称为思维链(Chain-of-Thought, CoT)的技术尤为有趣,因为正如我们在本工作中指出的,它类似于通过多次重复应用模型来使用更深的 transformer。然而,在计算过去 token 的注意力时存在一个关键细微差别,使 CoT 不同于简单地多次应用模型。基于这一洞见,我们提出 CoTFormer,一种在 token 级别紧密模仿 CoT 的新型架构,使我们能获得接近远大于它的模型的显著更高准确率。虽然应用 CoT 会带来额外的计算开销,我们通过利用 CoTFormer 与 token 级可变深度的特殊兼容性来弥补。通过一个计算自适应模型——它自动将计算分配给最需要的 token——我们表明,可以在不损失任何准确率的情况下显著降低计算开销,并且还能进一步降低计算成本,同时保持有竞争力的准确率。
引用
@article{arxiv.2310.10845,
title = {CoTFormer: A Chain-of-Thought Driven Architecture with Budget-Adaptive Computation Cost at Inference},
author = {Amirkeivan Mohtashami and Matteo Pagliardini and Martin Jaggi},
journal= {arXiv preprint arXiv:2310.10845},
year = {2024}
}