中文

ERUPD -- 英-罗马尼亚乌尔都平行数据集

计算与语言 2024-12-24 v1

摘要

搭建语言间的鸿沟有助于全球化发展和文化交流。本研究通过构建包含75,146对句子的新型平行数据集,解决了罗马尼亚乌尔都(Roman Urdu)——一种广泛用于数字通信的乌尔都语言的拉丁字母变体——的挑战。罗马尼亚乌尔都缺乏标准化、语音可变性以及与英语的代码切换,给语言处理带来复杂性。我们采用结合高级提示工程生成的合成数据与来自个人消息群组的真实对话数据中的混合方法。我们进一步通过人类评估阶段细化了数据集,解决了语言不一致性,确保代码切换、语音表示和同义词可变性的准确性。最终得到的数据集捕捉了罗马尼亚乌尔都的多样化语言特征,为机器翻译、情感分析和多语言教育提供了关键资源。

关键词

引用

@article{arxiv.2412.17562,
  title  = {ERUPD -- English to Roman Urdu Parallel Dataset},
  author = {Mohammed Furqan and Raahid Bin Khaja and Rayyan Habeeb},
  journal= {arXiv preprint arXiv:2412.17562},
  year   = {2024}
}

备注

9 pages, 1 figure