FastMem:通过快速记忆提示提高大语言模型的上下文感知能力
计算与语言
2024-10-08 v3 人工智能
摘要
大语言模型(LLMs)在生成连贯文本方面表现出色,但常在上下文感知方面吃力,导致在需要严格遵循提供信息的任务中出现错误。我们引入 FastMem,一种新方法,旨在通过快速记忆提示提升指令微调 LLMs 的上下文感知能力。FastMem 通过仅更新最后一个前馈网络(FFN)模块来最大化提示的似然,从而实现高效优化,同时避免过拟合,显著提高模型理解和准确遵循上下文的能力。我们的实验表明,在阅读理解、文本摘要和遵循输出结构方面均取得显著提升。例如,FastMem 将 Llama 3-8B-Inst 在 NQ-SWAP 数据集上的准确率从 59.1% 提升至 71.6%,将 Qwen 1.5-4B-Chat 的输出结构失败率从 34.9% 降至 25.5%。广泛的实验结果凸显了 FastMem 为各种应用提供提升 LLMs 可靠性和准确性的强大解决方案的潜力。我们的代码可在 https://github.com/IAAR-Shanghai/FastMem 获取。
引用
@article{arxiv.2406.16069,
title = {FastMem: Fast Memorization of Prompt Improves Context Awareness of Large Language Models},
author = {Junyi Zhu and Shuochen Liu and Yu Yu and Bo Tang and Yibo Yan and Zhiyu Li and Feiyu Xiong and Tong Xu and Matthew B. Blaschko},
journal= {arXiv preprint arXiv:2406.16069},
year = {2024}
}