中文

探究大语言模型在长文本问答中的可答性

计算与语言 2023-09-18 v1

摘要

随着我们迈入大语言模型(LLM)的新时代,理解其能力、局限与差异变得愈发关键。为在此方向上取得进一步进展,我们力求对大规模 LLM(如 ChatGPT)与更小却高效的开源 LLM 及其蒸馏版本之间的差距建立更深入的理解。为此,我们特别关注长文本问答(LFQA),因其具有若干实际且有影响的用途(如故障排查、客户服务等),却仍研究不足且对 LLM 构成挑战。我们提出一种基于抽象摘要的问题生成方法,并表明从长文档摘要生成后续问题可为 LLM 从长上下文中推理与推断创造具有挑战性的设定。我们的实验结果证实:(1) 我们所提出的从抽象摘要生成问题的方法为 LLM 带来了挑战性设定,并显示出 ChatGPT 等 LLM 与开源 LLM(Alpaca、Llama)之间的性能差距;(2) 开源 LLM 对从原始文档生成的问题表现出对上下文依赖的降低,但其在基于摘要生成的问题上的生成能力显著下降——尤其对于更长上下文(>1024 tokens)。

关键词

引用

@article{arxiv.2309.08210,
  title  = {Investigating Answerability of LLMs for Long-Form Question Answering},
  author = {Meghana Moorthy Bhat and Rui Meng and Ye Liu and Yingbo Zhou and Semih Yavuz},
  journal= {arXiv preprint arXiv:2309.08210},
  year   = {2023}
}