中文

面向长篇单说话人实时 MRI 发声数据集与基准

声音 2025-09-19 v1

摘要

我们发布 USC Long Single-Speaker (LSS) 数据集,包含来自美国英语母语说话人在语音产生期间的声学数据与实时 MRI 视频。该独特数据集包含约一小时的视频与音频数据,目前是公开可用的最长单说话人实时 MRI 发声数据集之一。除声学与 articulatory 原始数据外,我们还提供适用于多种下游任务的衍生表示,包括面部部位裁剪后的视频、句子级数据分割、恢复及去噪后的音频、以及兴趣区域时间序列。我们还对该数据集在 articulatory 合成与音素识别任务上进行基准测试,提供相应的 baseline 性能,供后续研究者提升使用。

关键词

引用

@article{arxiv.2509.14479,
  title  = {A long-form single-speaker real-time MRI speech dataset and benchmark},
  author = {Sean Foley and Jihwan Lee and Kevin Huang and Xuan Shi and Yoonjeong Lee and Louis Goldstein and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2509.14479},
  year   = {2025}
}