中文

GNNavi:通过图神经网络导航大语言模型中的信息流

计算与语言 2024-06-10 v2 人工智能

摘要

大语言模型(LLMs)在使用带有演示的提示时表现出强大的上下文学习(ICL)能力。然而,微调对于进一步增强其适应性仍然至关重要。基于提示的微调被证明是低数据场景下的一种有效微调方法,但对计算资源的高需求限制了其实用性。我们通过引入一种基于提示的参数高效微调(PEFT)方法来解决这个问题。GNNavi 利用了对 ICL 信息流动态的洞察,这表明标签词在提示中充当信息传播的锚点。GNNavi 采用图神经网络(GNN)层,通过将期望的信息流硬编码到 GNN 中,精确引导提示处理过程中信息流的聚合和分布。我们在 GPT-2 和 Llama2 上的文本分类任务实验表明,GNNavi 仅更新 0.2% 到 0.5% 的参数,就在少样本设置中超越了标准的基于提示的微调方法。我们将 GNNavi 与前流行的 PEFT 方法(如 prefix tuning、LoRA 和 Adapter)在性能和效率方面进行了比较。我们的分析表明,GNNavi 增强了信息流并确保了清晰的聚合过程。

关键词

引用

@article{arxiv.2402.11709,
  title  = {GNNavi: Navigating the Information Flow in Large Language Models by Graph Neural Network},
  author = {Shuzhou Yuan and Ercong Nie and Michael Färber and Helmut Schmid and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2402.11709},
  year   = {2024}
}

备注

ACL2024 Findings