中文

CoLI——用于坎纳达-英语文本中词级混合语言识别的机器学习方法

计算与语言 2022-11-21 v1 人工智能 计算机与社会 机器学习

摘要

自动识别给定文本中所使用语言的任务称为语言识别(LI)。印度是一个多语言国家,许多印度人尤其是年轻人除本地语言外,也能熟练使用印地语和英语。因此,他们常使用多于一种语言在社交媒体上发布评论。包含多种语言的文本称为“混合语言文本”,是 LI 的良好输入来源。这些文本中的语言可能在句子级、词级甚至子词级混合。词级 LI 是一个序列标注问题,其中句子中每个词都被标注为预定义语言集合中的某一种语言。为解决坎纳达-英语(Kn-En)混合文本中的词级 LI,本工作提出:i) 构建称为 CoLI-Kenglish 数据集的混合语言 Kn-En 数据集,ii) 混合语言 Kn-En 词嵌入,以及 iii) 使用机器学习(ML)、深度学习(DL)和迁移学习(TL)方法的学习模型。从坎纳达 YouTube 视频评论中提取混合语言 Kn-En 文本以构建 CoLI-Kenglish 数据集和混合语言 Kn-En 嵌入。CoLI-Kenglish 数据集中的词被分为六大类,即“坎纳达语”、“英语”、“混合语言”、“名称”、“地点”和“其他”。基于 ML 的 CoLI-vectors 和 CoLI-ngrams、基于 DL 的 CoLI-BiLSTM 以及基于 TL 的 CoLI-ULMFiT 等学习模型被构建并使用 CoLI-Kenglish 数据集进行评估。学习模型的性能表明,CoLI-ngrams 模型优于其他模型,其宏平均 F1 得分为 0.64。然而,所有学习模型的结果彼此间都颇具竞争性。

关键词

引用

@article{arxiv.2211.09847,
  title  = {CoLI-Machine Learning Approaches for Code-mixed Language Identification at the Word Level in Kannada-English Texts},
  author = {H. L. Shashirekha and F. Balouchzahi and M. D. Anusha and G. Sidorov},
  journal= {arXiv preprint arXiv:2211.09847},
  year   = {2022}
}