时间同时性预测情感语料库中的注释质量
计算与语言
2026-05-27 v1
摘要
当标注活动跨越数周或数月且仅有小型标注团队时,维持注释质量具有难度。我们 presented 一组包含3,565条推文的 Setswana 情感数据集,由三个母语标注者在八个批次中进行注释,并检讨了跨时间段的注释质量为何会下降。尽管整体的兰开斯特自由边际 Kappa 为 ,但按批次的 在注释任务中下降超过32个分点。通过六项针对性分析,我们发现:(i)标签混淆集中在负面/中性边界上,(ii)两个标注者显示出与自律标签一致的运行长度漂移,(iii) 的主要预测器是时间同时性:在一分钟内标注的推文实现 ,而超过一天标注的推文仅达到 。标注速度和推文级别的语言特征与 无显著关联。我们对三个开源多语言编码器和专有模型(GPT-5 和 Gemini)在三类情感分类上进行基准测试;微调相对于预训练基线提升了29至43个宏F1分点,其中GPT-5 Few-shot 整体表现最佳(62.2 宏F1)。我们发布了数据集、每条注释的时间戳以及分析代码,以支持可重复的质量审计,为未来的非洲语言 NLP 资源提供支持。
引用
@article{arxiv.2605.27239,
title = {Temporal Simultaneity Predicts Annotation Quality in Sentiment Corpora},
author = {Idris Abdulmumin and Mokgadi Penelope Matloga and Tadesse Destaw Belay and Botshelo Kondowe and Letlhogonolo Mohleleng and Hareaipha Nkopo Letsoalo and Shamsuddeen Hassan Muhammad and Vukosi Marivate},
journal= {arXiv preprint arXiv:2605.27239},
year = {2026}
}