中文

CNMBERT:将汉语拼音缩写转换为中文字符的模型

计算与语言 2025-01-29 v4 人工智能

摘要

将汉语拼音缩写转换为中文字符的任务是中文拼写纠正(CSC)领域的一个重要分支, 在诸多下游应用中发挥重要作用, 如命名实体识别和情感分析. 该任务通常涉及文本长度对齐, 看似容易解决; 然而, 由于拼音缩写信息含量有限, 实现准确转换颇具挑战. 本文将其视为填充掩码任务, 提出CNMBERT, 即zh-CN Pinyin Multi-mask BERT Model, 以解决此问题. 通过引入多掩码策略和混合专家(MoE)层, CNMBERT在10,373样本的测试数据集上 outperform fine-tuned GPT模型和ChatGPT-4o, 获得61.53%的MRR得分和51.86%的准确率.

关键词

引用

@article{arxiv.2411.11770,
  title  = {CNMBERT: A Model for Converting Hanyu Pinyin Abbreviations to Chinese Characters},
  author = {Zishuo Feng and Feng Cao},
  journal= {arXiv preprint arXiv:2411.11770},
  year   = {2025}
}

备注

8 pages, 5 figures, 8 tables