中文

READIN:具有真实且多样输入噪声的中文多任务基准

计算与语言 2023-05-26 v2

摘要

对于许多现实应用,用户生成的输入通常由于语言变体引起的语音识别错误或印刷错误(typos)而包含各种噪声。因此,在具有真实输入噪声的数据上测试模型性能以确保鲁棒性和公平性至关重要。然而,针对中文构建此类基准的研究很少,而现实中会发生各种语言特定的输入噪声。为填补这一重要空白,我们构建了 READIN:一个具有真实且多样输入噪声(REalistic And Diverse Input Noises)的中文多任务基准。READIN 包含四项多样任务,并要求标注人员使用两种常用中文输入法——拼音输入和语音输入——重新录入原始测试数据。我们设计了标注流程以最大化多样性,例如指导标注人员使用多样的输入法编辑器(IMEs)以产生键盘噪声,并招募来自不同方言群体的说话人以产生语音噪声。我们使用一系列强预训练语言模型以及鲁棒训练方法进行实验,发现即便采用数据增强等鲁棒性方法,这些模型在 READIN 上仍经常出现显著性能下降。作为创建面向用户生成输入的带噪声基准的首次大规模尝试,我们认为 READIN 是对现有中文 NLP 基准的重要补充。源代码与数据集可从 https://github.com/thunlp/READIN 获取。

关键词

引用

@article{arxiv.2302.07324,
  title  = {READIN: A Chinese Multi-Task Benchmark with Realistic and Diverse Input Noises},
  author = {Chenglei Si and Zhengyan Zhang and Yingfa Chen and Xiaozhi Wang and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2302.07324},
  year   = {2023}
}

备注

ACL 2023