中文

一个具有多跨度答案的开放域问答数据集

计算与语言 2024-02-16 v1 人工智能

摘要

多跨度答案抽取,也称为多跨度问答 (MSQA) 任务,对于现实世界应用至关重要,因为它需要从文本中提取多条信息以回答复杂问题。尽管英语 MSQA 研究活跃且进展迅速,但中文领域明显缺乏公开可用的 MSQA 基准。以往构建 MSQA 数据集的努力主要强调以实体为中心的上下文化,导致偏向收集事实型问题,并可能忽略需要更详细描述性回答的问题。为了克服这些局限性,我们提出了 CLEAN,这是一个全面的中文多跨度问答数据集,涉及广泛的开放域主题,并包含大量需要描述性答案的实例。此外,我们提供了相关文献中的成熟模型作为 CLEAN 的基线。实验结果和分析展示了新提出的 CLEAN 数据集对社区的特征与挑战。我们的数据集 CLEAN 将在 zhiyiluo.site/misc/clean_v1.0_sample.json 公开发布。

关键词

引用

@article{arxiv.2402.09923,
  title  = {A Dataset of Open-Domain Question Answering with Multiple-Span Answers},
  author = {Zhiyi Luo and Yingying Zhang and Shuyun Luo and Ying Zhao and Wentao Lyu},
  journal= {arXiv preprint arXiv:2402.09923},
  year   = {2024}
}