中文

解构变压器中的乘法:对LLM的洞察

计算与语言 2024-07-23 v1

摘要

Transformer-based大型语言模型在各种自然语言处理任务上取得了显著成绩。然而,他们常常在看似简单的任务(如算术)上表现不佳,尽管拥有庞大的能力。这一显著差异引发了人们对其安全与伦理使用的担忧,阻碍了其广泛采用。在本文中,我们聚焦于典型的整数乘法算术任务,以探索和解释Transformer在该领域的不完美。我们对一个训练执行n位整数乘法的基础Transformer进行了全面分析。我们的观察表明,该模型将乘法任务分解为多个平行子任务,依次优化每个数字的每个子任务以完成最终乘法。基于观察与分析,我们推断Transformer在乘法任务中存在缺陷的原因在于其难以计算连续的进位并缓存中间结果,并通过实验确认了这一推断。在此基础上,我们提出了改进措施以增强Transformer在乘法任务上的性能。这些增强通过严格的测试和数学建模得到验证,不仅提升了Transformer的可解释性,也提升了其性能,例如我们在小型Transformer上实现了对5位数整数乘法的99.9%以上准确率,超越了GPT-4。本工作为更广泛的模型理解和可解释性领域奠定了基础,为分析更复杂的任务和Transformer模型铺平了道路。这一工作强调了可解释AI的重要性,有助于建立对大型语言模型的信任,促进其在关键应用中的采用。

关键词

引用

@article{arxiv.2407.15360,
  title  = {Dissecting Multiplication in Transformers: Insights into LLMs},
  author = {Luyu Qiu and Jianing Li and Chi Su and Chen Jason Zhang and Lei Chen},
  journal= {arXiv preprint arXiv:2407.15360},
  year   = {2024}
}

备注

8 pages, 5 figures