COMI-LINGUA:面向 Hindi-English 双语代码混合文本的大规模 Expert 标注数据集
计算与语言
2025-09-18 v3 人工智能
摘要
我们介绍 COMI-LINGUA,这是目前规模最大的人工标注的印地语-英语代码混合数据集,涵盖五个核心 NLP 任务:矩阵语言识别、词级语言识别、词性标注、命名实体识别和机器翻译。每个实例都由三位双语标注员标注,产生超过 37.6 万项专家标注,具备较强的注释者一致性(Fleiss' Kappa 0.81)。该数据集经过严格的预处理和过滤,覆盖Devanagari 和罗马文字,涵盖多样领域,确保了真实世界语言的覆盖。评估结果表明,闭源大语言模型在零样本设置下显著优于传统工具和开源模型,尤其在结构敏感预测(如词性标注和命名实体识别)方面,一键式提示 consistently 能显著提升性能。对 COMI-LINGUA 上微调最新大语言模型可实现显著提升,NER F1 最高达 95.25,MLI F1 达 98.77,机器翻译性能也表现出竞争力,为 Hinglish 代码混合文本设立了新基准。COMI-LINGUA 已公开于本 URL 提供: https://huggingface.co/datasets/LingoIITGN/COMI-LINGUA。
引用
@article{arxiv.2503.21670,
title = {COMI-LINGUA: Expert Annotated Large-Scale Dataset for Multitask NLP in Hindi-English Code-Mixing},
author = {Rajvee Sheth and Himanshu Beniwal and Mayank Singh},
journal= {arXiv preprint arXiv:2503.21670},
year = {2025}
}