MCSCSet:面向医学领域中文拼写纠正的专家标注数据集
计算与语言
2022-10-24 v1
摘要
中文拼写纠正(CSC)因能自动检测并修正中文文本中的拼写错误而受到越来越多的关注。尽管其在搜索引擎与光学字符识别系统等许多应用中被广泛使用,但在复杂且不常见医学实体易被误写的医疗场景中鲜有探索。由于需要特定领域知识,纠正医学实体的拼写错误比开放领域更为困难。本工作中,我们定义了医学领域中文拼写纠正任务,并提出 MCSCSet——一个包含约 20 万样本的大规模专家标注数据集。与现有开放领域 CSC 数据集不同,MCSCSet 包含:i)从腾讯医典收集的大量真实医疗查询,ii)由医学专家人工标注的对应错误句子。为实现自动化数据集构建,MCSCSet 进一步提供了由给定中文医学术语的常见误写字符组成的医学混淆集。这使得人们能够自动创建医学误写数据集。大量实证研究显示开放领域与医学领域拼写纠正之间存在显著性能差距,凸显了开发高质量数据集以支持特定领域中文拼写纠正的必要性。此外,我们的工作对若干代表性中文拼写纠正模型进行了基准测试,为未来研究建立了基线。
引用
@article{arxiv.2210.11720,
title = {MCSCSet: A Specialist-annotated Dataset for Medical-domain Chinese Spelling Correction},
author = {Wangjie Jiang and Zhihao Ye and Zijing Ou and Ruihui Zhao and Jianguang Zheng and Yi Liu and Siheng Li and Bang Liu and Yujiu Yang and Yefeng Zheng},
journal= {arXiv preprint arXiv:2210.11720},
year = {2022}
}
备注
The full version of CIKM 2022 accepted resource paper "MCSCSet: A Specialist-annotated Dataset for Medical-domain Chinese Spelling Correction". (https://dl.acm.org/doi/10.1145/3511808.3557636)