中文

通过问答注意力片段提取增强预训练生成式语言模型在机器阅读理解中的表现

计算与语言 2024-10-17 v3

摘要

机器阅读理解 (MRC) 是自然语言处理领域的一个重要挑战。虽然主流 MRC 方法主要依赖于基于 BERT 等编码器模型的抽取策略,但生成式方法面临生成失控的问题——即生成的答案常常不正确、不相关或不忠实于源文本。为解决生成式模型在 MRC 中存在的局限性,我们引入了问题注意力片段提取 (Question-Attended Span Extraction, QASE) 模块。该模块集成于预训练生成式语言模型 (PLM) 的微调阶段,显著提升了其性能,使其在 few-shot 设置下能够超越如 GPT-4 等高级大型语言模型 (LLM) 的抽取能力。值得注意的是,这些性能提升并未增加计算需求。QASE 模块的有效性在 various 数据集上进行了严格测试,始终实现或超越了最先进 (SOTA) 结果,从而在抽取式 MRC 任务中弥合了生成式与抽取式模型之间的差距。

关键词

引用

@article{arxiv.2404.17991,
  title  = {Enhancing Pre-Trained Generative Language Models with Question Attended Span Extraction on Machine Reading Comprehension},
  author = {Lin Ai and Zheng Hui and Zizhou Liu and Julia Hirschberg},
  journal= {arXiv preprint arXiv:2404.17991},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2403.04771