中文

Kr\'eyoLID:从语言识别走向语言挖掘

计算与语言 2025-03-11 v1

摘要

自动语言识别通常被构建为一个多类分类问题。然而,在为较少被书写的语言创建数字语料库时,将其视为一个数据挖掘问题可能更为合适。对于这些语言变体,人们事先就知道绝大多数文档是不感兴趣的。通过最小化用于分类此类文档的资源,与使用现有流水线相比,我们可以更快且覆盖更广地创建语料库。为了展示语言挖掘视角的有效性,我们为几种基于法语的克里奥尔语引入了一种新的流水线和语料库。

关键词

引用

@article{arxiv.2503.06547,
  title  = {Kr\'eyoLID From Language Identification Towards Language Mining},
  author = {Rasul Dent and Pedro Ortiz Suarez and Thibault Clérice and Benoît Sagot},
  journal= {arXiv preprint arXiv:2503.06547},
  year   = {2025}
}

备注

8 main pages