中文

合成音频对认知状态任务有益

声音 2025-02-12 v1 人工智能 计算与语言 机器学习

摘要

NLP 社区广泛关注基于文本的认知状态任务方法,但语音可以通过语气等信息提供关键缺失线索。我们认为文本转语音模型在学习生成自然化语音的过程中会追踪认知状态的某些方面,而语音模型隐式识别的信息与语言模型所利用的信息是正交的。我们提出了合成音频数据微调 (SAD) 框架,展示了 7 项与认知状态建模相关的任务在基于文本和零样本合成音频数据(来自成熟的语音合成系统)的多模态训练中受益。我们证明,在添加合成音频数据到文本-only 语料库后,相对于文本-only 模式可实现提升。此外,在包含真实音频的任务和语料库上,我们展示的 SAD 框架在文本和合成音频与文本和真实音频之间实现了竞争性的性能。

关键词

引用

@article{arxiv.2502.06922,
  title  = {Synthetic Audio Helps for Cognitive State Tasks},
  author = {Adil Soubki and John Murzaku and Peter Zeng and Owen Rambow},
  journal= {arXiv preprint arXiv:2502.06922},
  year   = {2025}
}

备注

John Murzaku and Adil Soubki contributed equally to this work