中文

Orca:一个中文对话式机器阅读理解少样本基准

计算与语言 2023-10-16 v2 人工智能

摘要

对话式机器阅读理解(CMRC)任务旨在回答对话中的问题,因其广泛应用近年成为研究热点。然而,现有 CMRC 基准中每轮对话分配静态段落,与真实场景不一致,难以合理评估模型对真实场景的理解能力。为此,我们提出首个中文 CMRC 基准 Orca,并进一步提供零样本/少样本设定以评估模型跨领域的泛化能力。我们收集了 831 段由热点话题驱动的对话,共计 4,742 轮。对话每轮分配与回复相关的段落,旨在更合理地评估模型理解能力。对话话题采集自社交媒体平台,覆盖 33 个领域,力求与真实场景一致。重要的是,Orca 中的答案均为精心标注的自然回复,而非先前数据集中特定的片段或短短语。此外,我们实现了三个强基线以应对 Orca 中的挑战。结果表明我们的 CMRC 基准具有很大挑战性。我们的数据集与检查点可在 https://github.com/nuochenpku/Orca 获取。

关键词

引用

@article{arxiv.2302.13619,
  title  = {Orca: A Few-shot Benchmark for Chinese Conversational Machine Reading Comprehension},
  author = {Nuo Chen and Hongguang Li and Junqing He and Yinan Bao and Xinshi Lin and Qi Yang and Jianfeng Liu and Ruyi Gan and Jiaxing Zhang and Baoyuan Wang and Jia Li},
  journal= {arXiv preprint arXiv:2302.13619},
  year   = {2023}
}

备注

14 pages