中文

序列到序列的多模态语音修复

声音 2024-06-04 v1 人工智能 机器学习 多媒体 音频与语音处理

摘要

语音修复是利用可靠的上下文信息重建缺失音频内容的任务。尽管近年来在音频修复的多模态感知方面已有诸多研究,但在语音修复中如何有效融合视觉和听觉信息仍是一个需求。本文提出了一种新颖的序列到序列模型,该模型通过编码器-解码器架构利用视觉信息修复音频信号。编码器扮演面部录制的唇读器角色,解码器则同时接收编码器输出以及失真的音频频谱图,以恢复原始语音。在300毫秒至1500毫秒时长的失真条件下,我们的模型在语音质量和可懂度指标上优于仅依赖音频的语音修复模型,并与近期的一种多模态语音修复器结果相当,这证明了所引入的多模态在语音修复中的有效性。

关键词

引用

@article{arxiv.2406.01321,
  title  = {Sequence-to-Sequence Multi-Modal Speech In-Painting},
  author = {Mahsa Kadkhodaei Elyaderani and Shahram Shirani},
  journal= {arXiv preprint arXiv:2406.01321},
  year   = {2024}
}