中文

面向中文机器阅读理解的自然响应生成

计算与语言 2023-10-10 v2 人工智能

摘要

机器阅读理解(MRC)是对话智能体一个重要且备受关注的领域。然而,当前 MRC 基准存在一个显著局限:标注答案大多是从目标语料中抽取的片段或给定候选的选项,忽略了高质量响应的自然性。因此,在这些数据集上训练的 MRC 模型无法在真实问答场景中生成类人响应。为此,我们构建了名为 Penguin 的新数据集以推动 MRC 研究,为真实场景中的自然响应生成提供训练和测试平台。具体而言,Penguin 包含 20 万条具有高质量、流畅且信息充分的响应的训练数据。Penguin 是首个面向中文 MRC 自然响应生成、规模相对较大的基准。为应对 Penguin 中的挑战,我们开发了两种强基线:端到端和两阶段框架。随后,我们进一步设计 Prompt-BART:在 Penguin 中用混合前缀提示微调预训练生成语言模型。大量实验验证了该设计的有效性。

关键词

引用

@article{arxiv.2302.08817,
  title  = {Natural Response Generation for Chinese Reading Comprehension},
  author = {Nuo Chen and Hongguang Li and Yinan Bao and Baoyuan Wang and Jia Li},
  journal= {arXiv preprint arXiv:2302.08817},
  year   = {2023}
}

备注

15 pages