学习识别方言特征
计算与语言
2021-05-10 v3
摘要
构建服务于所有人的NLP系统需要考虑方言差异。但方言并非铁板一块:相反,方言之间及方言内部的区别由语音和文本中数十种方言特征的存在、缺失与频率所刻画,例如“He {} running”中系词的删略。本文引入方言特征检测任务,并提出两种基于预训练transformers的多任务学习方法。对于大多数方言,这些特征的大规模标注语料不可用,导致难以训练识别器。我们在少量最小对上训练模型,依托语言学家通常定义方言特征的方式。在包含印度英语22种方言特征的测试集上的评估表明,这些模型学会以高准确率识别许多特征,且少量最小对可媲美数千标注样本的训练效果。我们还展示了方言特征检测作为方言密度度量与方言分类器的下游适用性。
引用
@article{arxiv.2010.12707,
title = {Learning to Recognize Dialect Features},
author = {Dorottya Demszky and Devyani Sharma and Jonathan H. Clark and Vinodkumar Prabhakaran and Jacob Eisenstein},
journal= {arXiv preprint arXiv:2010.12707},
year = {2021}
}
备注
NAACL camera-ready