中文

加固注意力中的最短木板:增强大语言模型的上下文感知能力以实现有效工具使用

计算与语言 2024-06-05 v4 人工智能 机器学习

摘要

在本文中,我们证明了大语言模型(LLMs)注意力分配中固有的波形模式显著影响其在需要高度上下文感知的任务(例如利用LLMs进行工具使用)中的性能。具体来说,当上下文中的关键信息位于注意力波形的波谷区域时,模型可能会忽略它,从而导致性能下降。为了解决这个问题,我们提出了一种名为注意力桶(Attention Buckets)的新型推理方法。它允许LLMs通过多个并行过程处理其输入。每个过程为旋转位置嵌入使用不同的基角,从而创建一个独特的注意力波形。通过用另一个过程的注意力波峰补偿某个过程的注意力波谷,我们的方法增强了LLM对各种上下文位置的感知,从而降低了忽略关键信息的风险。在最大的工具使用基准测试中,我们的方法将一个7B模型提升至最先进的性能,可与GPT-4相媲美。在其他同样要求彻底理解上下文内容的基准测试和一些RAG任务中,注意力桶也表现出了显著的性能提升。

关键词

引用

@article{arxiv.2312.04455,
  title  = {Fortify the Shortest Stave in Attention: Enhancing Context Awareness of Large Language Models for Effective Tool Use},
  author = {Yuhan Chen and Ang Lv and Ting-En Lin and Changyu Chen and Yuchuan Wu and Fei Huang and Yongbin Li and Rui Yan},
  journal= {arXiv preprint arXiv:2312.04455},
  year   = {2024}
}

备注

ACL 2024 main