CCAE:一个基于中文的亚洲英语语料库
计算与语言
2023-10-10 v1 人工智能
机器学习
摘要
语言模型已成为各类NLP应用的基础,但即便对于英语这样最流行的语言,其在语言变体研究中也未得到良好应用。本文是利用NLP技术于世界英语(World Englishes)范式中的少数初期努力之一,具体体现为创建一个用于研究亚洲英语的多变体语料库。我们概述了CCAE——基于中文的亚洲英语语料库,一套包含六种基于中文的亚洲英语变体的语料库。它基于来自六个地区的44.8万篇网络文档中的3.4亿词符。数据的本体将使该语料库成为对亚洲英语(尤其是迄今尚无公开可访问语料库的中国英语)具有巨大研究潜力的有用资源,以及用于变体特定语言建模与下游任务的理想来源,从而为基于NLP的世界英语研究奠定基础。在该语料库上的初步实验揭示了CCAE的实用价值。最后,我们在\href{https://huggingface.co/datasets/CCAE/CCAE-Corpus}{this https URL}提供了CCAE。
引用
@article{arxiv.2310.05381,
title = {CCAE: A Corpus of Chinese-based Asian Englishes},
author = {Yang Liu and Melissa Xiaohui Qin and Long Wang and Chao Huang},
journal= {arXiv preprint arXiv:2310.05381},
year = {2023}
}
备注
NLPCC'2023 (12 pages, 3 figures, 4 charts)