Prabhupadavani:一个面向 25 种语言的码混语音翻译数据集
计算与语言
2022-09-07 v2
摘要
如今,对码混(code-mixing)的兴趣在自然语言处理(NLP)中已无处不在;然而,针对语音翻译(ST)任务解决此现象的关注甚少。这完全可归因于缺乏码混 ST 任务的标注数据。因此,我们引入了 Prabhupadavani,这是一个面向 25 种语言的多语码混 ST 数据集。它多领域、涵盖十个语系,包含 130 余位说话人总计 94 小时语音,并人工对齐了目标语言相应文本。Prabhupadavani 涉及来自印度文献的吠陀文化与遗产,其中在引用文献时的语码转换在人文教学语境中十分重要。据我们所知,Prabhupadavani 是 ST 文献中首个多语码混 ST 数据集。该数据也可用于码混机器翻译任务。所有数据集可在 https://github.com/frozentoad9/CMST 获取。
引用
@article{arxiv.2201.11391,
title = {Prabhupadavani: A Code-mixed Speech Translation Data for 25 Languages},
author = {Jivnesh Sandhan and Ayush Daksh and Om Adideva Paranjay and Laxmidhar Behera and Pawan Goyal},
journal= {arXiv preprint arXiv:2201.11391},
year = {2022}
}
备注
The work is accepted at COLING22-SIGHUM Workshop on Computational Linguistics for Cultural Heritage, Social Sciences, Humanities and Literature