Kr\'eyoLID:从语言识别走向语言挖掘
计算与语言
2025-03-11 v1
摘要
自动语言识别通常被构建为一个多类分类问题。然而,在为较少被书写的语言创建数字语料库时,将其视为一个数据挖掘问题可能更为合适。对于这些语言变体,人们事先就知道绝大多数文档是不感兴趣的。通过最小化用于分类此类文档的资源,与使用现有流水线相比,我们可以更快且覆盖更广地创建语料库。为了展示语言挖掘视角的有效性,我们为几种基于法语的克里奥尔语引入了一种新的流水线和语料库。
引用
@article{arxiv.2503.06547,
title = {Kr\'eyoLID From Language Identification Towards Language Mining},
author = {Rasul Dent and Pedro Ortiz Suarez and Thibault Clérice and Benoît Sagot},
journal= {arXiv preprint arXiv:2503.06547},
year = {2025}
}
备注
8 main pages