中文

FreCDo:一个大规模法语跨领域方言识别语料库

计算与语言 2022-12-16 v1 机器学习

摘要

我们提出一个新的法语方言识别语料库,包含从比利时、加拿大、法国和瑞士的公共新闻网站收集的 413,522 条法语文本样本。为确保对方言识别模型性能的准确估计,我们设计该语料库以消除与主题、写作风格和发布来源相关的潜在偏差。更确切地说,训练、验证和测试划分收集自不同的新闻网站,同时搜索不同的关键词(主题)。这引出了一个法语跨领域(FreCDo)方言识别任务。我们使用四个有竞争力的基线进行实验:一个微调的 CamemBERT 模型、一个基于微调 CamemBERT 特征的 XGBoost、一个基于微调 CamemBERT 特征的支持向量机(SVM)分类器,以及一个基于词 n-gram 的 SVM。除给出定量结果外,我们还对 CamemBERT 学到的最具判别性的特征进行了分析。我们的语料库可在 https://github.com/MihaelaGaman/FreCDo 获取。

关键词

引用

@article{arxiv.2212.07707,
  title  = {FreCDo: A Large Corpus for French Cross-Domain Dialect Identification},
  author = {Mihaela Gaman and Adrian-Gabriel Chifu and William Domingues and Radu Tudor Ionescu},
  journal= {arXiv preprint arXiv:2212.07707},
  year   = {2022}
}