MD3:多方言对话数据集
计算与语言
2023-05-22 v1
摘要
我们介绍了一个代表印度、尼日利亚和美国英语的会话语音新数据集。多方言对话数据集(MD3)通过引导参与者执行一系列简短的信息共享任务,在开放式会话语音与任务导向对话之间取得了新的平衡。这便于进行定量的跨方言比较,同时避免施加可能抑制方言特征表达的限制性任务结构。对该数据集的初步分析揭示了句法及话语标记使用上的显著差异。该数据集将在本文发表时公开提供,包含超过 20 小时音频和超过 200,000 个正字法转写词符。
引用
@article{arxiv.2305.11355,
title = {MD3: The Multi-Dialect Dataset of Dialogues},
author = {Jacob Eisenstein and Vinodkumar Prabhakaran and Clara Rivera and Dorottya Demszky and Devyani Sharma},
journal= {arXiv preprint arXiv:2305.11355},
year = {2023}
}
备注
InterSpeech 2023