中文

ViLexNorm:越南语社交媒体文本的词汇规范化语料库

计算与语言 2024-02-01 v2

摘要

词汇规范化是自然语言处理(NLP)中的一项基本任务,涉及将单词转换为其规范形式。事实证明,这一过程极大地有益于各种下游 NLP 任务。在这项工作中,我们介绍了越南语词汇规范化(ViLexNorm),这是首个为越南语词汇规范化任务开发的语料库。该语料库包含超过 10,000 对句子,由人工标注者精心标注,数据源自越南最流行社交媒体平台上的公开评论。我们使用了多种方法评估我们的语料库,表现最佳的系统在使用 Leave-As-Is (LAI) 基线时,通过误差降低率(Error Reduction Rate, ERR)指标(van der Goot, 2019a)达到了 57.74% 的结果。在外在评估中,使用在 ViLexNorm 上训练的模型证明了越南语词汇规范化任务对其他 NLP 任务的积极影响。我们的语料库仅公开用于研究目的。

关键词

引用

@article{arxiv.2401.16403,
  title  = {ViLexNorm: A Lexical Normalization Corpus for Vietnamese Social Media Text},
  author = {Thanh-Nhi Nguyen and Thanh-Phong Le and Kiet Van Nguyen},
  journal= {arXiv preprint arXiv:2401.16403},
  year   = {2024}
}

备注

Accepted at the EACL 2024 Main Conference