视觉感知的文本到语音合成
音频与语音处理
2023-06-22 v1 计算与语言
声音
摘要
在面对面交互中,动态合成能主动回应听话者头部的对话语音至关重要。例如,说话者可利用听话者的面部表情来调整语调、重读音节或停顿。本工作中,我们提出一项新的视觉感知文本到语音(VA-TTS)任务,用于基于面对面交流中文本输入与听话者顺序视觉反馈(如点头、微笑)合成语音。与传统文本到语音不同,VA-TTS 强调视觉模态的影响。在这一新提出的任务上,我们设计了一个基线模型,融合音素语言信息与听话者视觉信号以进行语音合成。在多模态对话数据集 ViCo-X 上的大量实验验证了我们所提方法可生成更具自然度、且节奏与韵律契合场景的音频。
引用
@article{arxiv.2306.12020,
title = {Visual-Aware Text-to-Speech},
author = {Mohan Zhou and Yalong Bai and Wei Zhang and Ting Yao and Tiejun Zhao and Tao Mei},
journal= {arXiv preprint arXiv:2306.12020},
year = {2023}
}
备注
accepted as oral and top 3% paper by ICASSP 2023