基于真实标签的语言变体识别
计算与语言
2023-03-03 v1
摘要
语言识别是许多 IR 和 NLP 应用的重要第一步。然而,大多数公开可用的语言识别数据集是在如下假设下编制的:每个实例的黄金标签由其文本获取地决定。研究表明这是一个有问题的假设,特别是在非常相似的语言(例如克罗地亚语和塞尔维亚语)以及民族语言变体(例如巴西葡萄牙语和欧洲葡萄牙语)的情况下,文本可能不包含特定语言或变体的区别性标记。为克服这一重要局限,本文提出 DSL True Labels (DSL-TL),首个用于语言变体识别的人工标注多语言数据集。DSL-TL 包含葡萄牙语共 12,900 个实例,分为欧洲葡萄牙语和巴西葡萄牙语;西班牙语,分为阿根廷西班牙语和卡斯蒂利亚西班牙语;以及英语,分为美国英语和英国英语。我们训练了多个模型来区分这些语言变体,并详细呈现结果。本文提供的数据和模型为开发鲁棒且更公平的语言变体识别系统提供了可靠基准。我们向研究界免费提供 DSL-TL。
引用
@article{arxiv.2303.01490,
title = {Language Variety Identification with True Labels},
author = {Marcos Zampieri and Kai North and Tommi Jauhiainen and Mariano Felice and Neha Kumari and Nishant Nair and Yash Bangera},
journal= {arXiv preprint arXiv:2303.01490},
year = {2023}
}