中文

代表性作为被遗忘的经验:多语言与语码转换数据收集与准备

计算与语言 2023-11-01 v1

摘要

多语言现象在全球范围内十分普遍,语码转换(CSW)是不同语言对/元组在各地和区域间的常见实践。然而,尽管大规模多语言语言模型(MMLMs)近期取得进展,构建成功的 CSW 系统仍进展甚微。我们通过一项针对现有 CSW 数据集(68 个)跨语言对在收集与准备(如转写和标注)阶段的批判性研究,调查了这一停滞背后的原因。这一深入分析揭示:a) 大多数 CSW 数据涉及英语而忽略其他语言对/元组;b) 由于忽略 CSW 中基于地域、社会人口和语域的差异,数据收集与准备阶段在代表性方面存在缺陷。此外,数据选择与过滤阶段缺乏清晰度遮蔽了 CSW 数据集的代表性。我们最后提供了一份简短检查清单,以改善未来涉及 CSW 数据收集与准备工作的代表性。

关键词

引用

@article{arxiv.2310.20470,
  title  = {Representativeness as a Forgotten Lesson for Multilingual and Code-switched Data Collection and Preparation},
  author = {A. Seza Doğruöz and Sunayana Sitaram and Zheng-Xin Yong},
  journal= {arXiv preprint arXiv:2310.20470},
  year   = {2023}
}

备注

Accepted for EMNLP'23 Findings (to appear on EMNLP'23 Proceedings)