估计方言程度预测多方言阿拉伯语数据集中的标注者间一致性
计算与语言
2024-06-10 v3 人工智能
摘要
在标注多方言阿拉伯语数据集时,通常将样本随机分配给母语为阿拉伯语的标注者。最近的分析建议将方言样本路由到其各自方言的母语者,以构建更高质量的数据集。然而,自动识别样本的方言是困难的。此外,特定阿拉伯方言母语标注者的池子可能稀缺。阿拉伯语方言程度(ALDi)最近被引入作为一个定量变量,衡量句子与标准阿拉伯语的偏离程度。在将样本随机分配给标注者时,我们假设具有较高ALDi分数的样本更难标注,特别是如果它们是用标注者不说的方言写的。我们通过分析ALDi分数与标注者一致性之间的关系来测试这一点,使用了15个公开数据集,这些数据集具有各种句子分类任务的原始个体样本标注。我们发现强有力的证据支持我们对其中11个数据集的假设。因此,我们建议优先将高ALDi分数的样本路由到每个样本方言的母语者,对于这些方言,可以以更高的准确率自动识别。
引用
@article{arxiv.2405.11282,
title = {Estimating the Level of Dialectness Predicts Interannotator Agreement in Multi-dialect Arabic Datasets},
author = {Amr Keleg and Walid Magdy and Sharon Goldwater},
journal= {arXiv preprint arXiv:2405.11282},
year = {2024}
}
备注
Accepted to ACL 2024 - Main (camera-ready version)