中文

ChiMDQA:面向细粒度评估的综合性中文文档问答

计算与语言 2025-11-06 v1 人工智能

摘要

随着自然语言处理(NLP)技术的快速发展,对高质量中文文档问答数据集的需求稳步增长。为了解决这个问题,我们提出了中文多文档问答数据集(ChiMDQA),专门为学术、教育、金融、法律、医疗和新闻等常见领域的下游业务场景而设计。ChiMDQA 涵盖了来自六个不同领域的篇幅较长的文档,包含 6,068 个经过严格筛选的高质量问答(QA)对,并进一步细分为十个细粒度类别。通过细致的文档筛选和系统化的问题设计方法,该数据集保证了多样性和高质量,使其适用于各种 NLP 任务,如文档理解、知识抽取和智能问答系统。此外,本文全面概述了数据集的设计目标、构建方法和细粒度评估系统,为未来中文问答的研究和实际应用提供了坚实的基础。代码和数据可在 https://anonymous.4open.science/r/Foxit-CHiMDQA/ 获取。

关键词

引用

@article{arxiv.2511.03656,
  title  = {ChiMDQA: Towards Comprehensive Chinese Document QA with Fine-grained Evaluation},
  author = {Jing Gao and Shutiao Luo and Yumeng Liu and Yuanming Li and Hongji Zeng},
  journal= {arXiv preprint arXiv:2511.03656},
  year   = {2025}
}

备注

13 pages, 6 tables, 4 figures, accepted by ICANN 2025