中文

探索合成音频数据在基于音频的对话状态跟踪中的可行性

声音 2023-12-05 v1 人工智能 音频与语音处理

摘要

对话状态跟踪在面向任务的对话系统中提取信息方面发挥着至关重要的作用。然而,由于缺乏真实的人类音频数据集,先前的研究局限于文本模态。我们通过研究用于基于音频的 DST 的合成音频数据来解决这一问题。为此,我们开发了级联和端到端模型,使用我们的合成音频数据集对其进行训练,并在真实人类语音数据上进行测试。为了便于针对音频模态进行评估,我们引入了新颖的 PhonemeF1 来捕捉发音相似度。实验结果表明,仅在合成数据集上训练的模型能够将其性能泛化到人类语音数据。通过消除对人类语音数据收集的依赖,这些见解为基于音频的 DST 的重大实际进展铺平了道路。数据和代码可在 https://github.com/JihyunLee1/E2E-DST 获取。

关键词

引用

@article{arxiv.2312.01842,
  title  = {Exploring the Viability of Synthetic Audio Data for Audio-Based Dialogue State Tracking},
  author = {Jihyun Lee and Yejin Jeon and Wonjun Lee and Yunsu Kim and Gary Geunbae Lee},
  journal= {arXiv preprint arXiv:2312.01842},
  year   = {2023}
}

备注

Accepted in ASRU 2023