MaskLID:通过迭代掩码进行语码转换语言识别
计算与语言
2024-06-11 v1
摘要
我们提出了 MaskLID,一种简单而有效的语码转换 (CS) 语言识别 (LID) 方法。MaskLID 不需要任何训练,旨在补充当前高性能的句子级 LID。句子级 LID 是在单语文本上训练的分类器,用于提供单一标签,通常使用 softmax 层将分数转化为概率。然而,在句子由 L1 和 L2 两种语言组成的情况下,LID 分类器通常只返回主导标签 L1。为解决这一局限,MaskLID 采用一种策略来掩码与 L1 相关的文本特征,使得 LID 在下一轮中将该文本分类为 L2。该方法利用 LID 自身来识别需要掩码的特征,且不依赖任何外部资源。在本工作中,我们探讨了将 MaskLID 用于两个基于 FastText 架构的开源 LID (GlotLID 和 OpenLID)。代码与演示可在 https://github.com/cisnlp/MaskLID 获取。
引用
@article{arxiv.2406.06263,
title = {MaskLID: Code-Switching Language Identification through Iterative Masking},
author = {Amir Hossein Kargaran and François Yvon and Hinrich Schütze},
journal= {arXiv preprint arXiv:2406.06263},
year = {2024}
}
备注
ACL 2024