中文

Prabhupadavani:一个面向 25 种语言的码混语音翻译数据集

计算与语言 2022-09-07 v2

摘要

如今,对码混(code-mixing)的兴趣在自然语言处理(NLP)中已无处不在;然而,针对语音翻译(ST)任务解决此现象的关注甚少。这完全可归因于缺乏码混 ST 任务的标注数据。因此,我们引入了 Prabhupadavani,这是一个面向 25 种语言的多语码混 ST 数据集。它多领域、涵盖十个语系,包含 130 余位说话人总计 94 小时语音,并人工对齐了目标语言相应文本。Prabhupadavani 涉及来自印度文献的吠陀文化与遗产,其中在引用文献时的语码转换在人文教学语境中十分重要。据我们所知,Prabhupadavani 是 ST 文献中首个多语码混 ST 数据集。该数据也可用于码混机器翻译任务。所有数据集可在 https://github.com/frozentoad9/CMST 获取。

关键词

引用

@article{arxiv.2201.11391,
  title  = {Prabhupadavani: A Code-mixed Speech Translation Data for 25 Languages},
  author = {Jivnesh Sandhan and Ayush Daksh and Om Adideva Paranjay and Laxmidhar Behera and Pawan Goyal},
  journal= {arXiv preprint arXiv:2201.11391},
  year   = {2022}
}

备注

The work is accepted at COLING22-SIGHUM Workshop on Computational Linguistics for Cultural Heritage, Social Sciences, Humanities and Literature