hinglishNorm——用于文本规范化的印地语-英语码混句子语料库
计算与语言
2020-10-20 v1
摘要
我们提出 hinglishNorm——一个用于文本规范化任务的人工标注印地语-英语码混句子语料库。语料库中的每句话都与其对应的人工标注规范化形式对齐。据我们所知,目前尚无公开可用的用于文本规范化任务的印地语-英语码混句子语料库。我们的工作是该方向上的首次尝试。该语料库包含 13494 个平行句段。此外,我们给出了在该语料库上的基线规范化结果。我们取得了 15.55 的词错误率(Word Error Rate, WER)、71.2 的双语互译评估辅助工具(BiLingual Evaluation Understudy, BLEU)分数,以及 0.50 的显式排序翻译评估度量(Metric for Evaluation of Translation with Explicit ORdering, METEOR)分数。
引用
@article{arxiv.2010.08974,
title = {hinglishNorm -- A Corpus of Hindi-English Code Mixed Sentences for Text Normalization},
author = {Piyush Makhija and Ankit Kumar and Anuj Gupta},
journal= {arXiv preprint arXiv:2010.08974},
year = {2020}
}
备注
Accepted in COLING2020 industry track, 8 pages (including references), 4 tables