中文

永不失落于中间:以位置无关分解训练掌握长上下文问答

计算与语言 2024-08-15 v2 人工智能

摘要

尽管大语言模型(LLMs)具备比以往更长的文本输入能力,它们仍难以在长上下文中搜寻正确信息。“迷失于中间”问题困扰着大多数 LLMs,指的是当正确信息位于中间位置时准确率急剧下降。为克服这一关键问题,本文提出通过专门设计的称为注意力强化多文档问答(ASM QA)的任务,增强 LLMs 在长上下文中的信息搜索与反思能力。遵循这些任务,我们的模型擅长更精确地聚焦于所需信息。实验结果显示在多文档问答及其他基准上取得实质性改进,在打乱设定下以 13.7% 绝对增益、在段落检索任务中以 21.5% 优于最先进模型。我们发布我们的模型 Ziya-Reader 以促进社区相关研究。

关键词

引用

@article{arxiv.2311.09198,
  title  = {Never Lost in the Middle: Mastering Long-Context Question Answering with Position-Agnostic Decompositional Training},
  author = {Junqing He and Kunhao Pan and Xiaoqun Dong and Zhuoyang Song and Yibo Liu and Qianguo Sun and Yuxin Liang and Hao Wang and Enming Zhang and Jiaxing Zhang},
  journal= {arXiv preprint arXiv:2311.09198},
  year   = {2024}
}

备注

Accepted by ACL 2024 main conference