中文

WYWEB:面向古汉语的 NLP 评测基准

计算与语言 2023-07-18 v1 人工智能

摘要

为了全面评估不同 NLP 模型在给定领域的整体表现,学界提出了许多评测基准,如 GLUE、SuperGLUE 和 CLUE。自然语言理解领域传统上侧重于针对中文、英文及多语言等各类任务设计的基准,然而,对于被称为“文言文”的古汉语领域却缺乏关注;古汉语拥有跨越数千年的丰富历史,并具有显著的文化与学术价值。为了推动 NLP 社区的繁荣,本文我们引入了 WYWEB 评测基准,其包含九项古汉语 NLP 任务,涵盖句子分类、序列标注、阅读理解与机器翻译。我们评估了现有的预训练语言模型,它们均在此基准上表现不佳。我们还引入了一些补充数据集与附加工具,以帮助促进古汉语自然语言理解领域的进一步进展。github 仓库为 https://github.com/baudzhou/WYWEB。

关键词

引用

@article{arxiv.2305.14150,
  title  = {WYWEB: A NLP Evaluation Benchmark For Classical Chinese},
  author = {Bo Zhou and Qianglong Chen and Tianyu Wang and Xiaomi Zhong and Yin Zhang},
  journal= {arXiv preprint arXiv:2305.14150},
  year   = {2023}
}

备注

Accepted by ACL 2023