在 1100 万干草堆中寻找针:循环记忆发现大语言模型所遗漏的内容
计算与语言
2024-02-22 v2 人工智能
机器学习
摘要
本文解决了利用生成式 Transformer 模型处理长文档的挑战。为了评估不同的方法,我们引入了 BABILong,这是一个旨在评估模型在广泛文本中提取和处理分布式事实能力的新基准。我们的评估包括针对 GPT-4 和 RAG 的基准测试,结果显示常用方法仅对长达个元素的序列有效。相比之下,经过带有循环记忆增强的微调后的 GPT-2 能够处理涉及多达个元素的任务。这一成就标志着巨大的飞跃,因为这是迄今为止任何神经网络模型处理过的最长输入,展示了长序列处理能力的显著提升。
引用
@article{arxiv.2402.10790,
title = {In Search of Needles in a 11M Haystack: Recurrent Memory Finds What LLMs Miss},
author = {Yuri Kuratov and Aydar Bulatov and Petr Anokhin and Dmitry Sorokin and Artyom Sorokin and Mikhail Burtsev},
journal= {arXiv preprint arXiv:2402.10790},
year = {2024}
}
备注
11M tokens, fix qa3 min facts per task in Table 1