注意力溢出:长上下文缺失项推荐中的语言模型输入模糊
计算与语言
2024-07-19 v1
摘要
大语言模型(LLM)能够根据提示中列出的项目推荐缺失元素,这可用于列表补全或基于用户历史的推荐。然而,当呈现的项目过多时,其性能会下降,因为它们开始建议输入列表中已包含的项目。对于2024年中期的旗舰LLM,这种情况大约在100个项目时发生。我们在合成问题(例如,在给定范围内的乱序整数中查找缺失数字)和现实的电影推荐场景中评估了这一现象。我们将此问题称为“注意力溢出”,因为防止重复需要同时关注所有项目。虽然迭代循环可以缓解此问题,但其成本会随着重复率的增加而增加,从而影响语言模型从长输入中获取新颖性的能力。
引用
@article{arxiv.2407.13481,
title = {Attention Overflow: Language Model Input Blur during Long-Context Missing Items Recommendation},
author = {Damien Sileo},
journal= {arXiv preprint arXiv:2407.13481},
year = {2024}
}
备注
Dataset URL: https://huggingface.co/datasets/sileod/missing-item-prediction