中文

SPACER:语音产生与理解中错误修复的平行数据集

计算与语言 2025-03-24 v1

摘要

语音错误是交流的自然组成部分,但它们很少导致完全的交流失败,因为说话者和理解者都能检测并纠正错误。尽管先前研究分别考察了产生与理解中的错误监控与纠正,但两个系统的整合研究一直受到平行数据匮乏的阻碍。在本研究中,我们提出了SPACER——一个平行数据集,捕捉自然语音错误如何由说话者和理解者共同纠正。我们聚焦于从Switchboard语料库中提取的单词替换错误,辅以说话者的自我修复以及来自离线文本编辑实验的理解者回应。我们的探索性分析揭示了错误修复策略的不对称性:说话者更倾向于修复引入更大语义和音位偏差的错误,而理解者倾向于纠正与更可信的替代选项音位相似或不契合先前上下文的错误。我们的数据集为未来研究语言产生与理解的整合方法提供了支持。

关键词

引用

@article{arxiv.2503.16745,
  title  = {SPACER: A Parallel Dataset of Speech Production And Comprehension of Error Repairs},
  author = {Shiva Upadhye and Jiaxuan Li and Richard Futrell},
  journal= {arXiv preprint arXiv:2503.16745},
  year   = {2025}
}

备注

11 pages, 11 figures