中文

情感化社交拟人智能系统

声音 2023-04-24 v1 人工智能 计算与语言 人机交互 机器学习

摘要

人类的对话风格通过幽默感、个性和语音语调来衡量。这些特征已成为对话式智能虚拟助手的关键要素。然而,大多数最先进的智能虚拟助手(IVA)未能解读人声的情感语义。本研究提出一种拟人智能系统,能够进行具有情感和个性的恰当类人对话。还提出了一种语音风格迁移方法来映射特定情感的属性。最初,通过转换时域音频波数据创建频域数据(梅尔谱图),其包含音符、音高、节奏和旋律等音频特征的离散模式。使用一种并行的CNN-Transformer-Encoder从语音中预测七种不同的情感状态。该语音还并行输入到deep-speech(一种从谱图生成文本转录的RNN模型)。然后转录文本通过混合技能对话、基于Transformer的检索与生成策略以及束搜索解码传输至多域对话代理,并生成恰当的文本响应。系统学习数据到潜空间的可逆映射,该映射可被操控并基于先前的梅尔谱图帧生成梅尔谱图帧以进行语音合成和风格迁移。最后,使用WaveGlow从谱图生成波形。我们在各独立模型上开展研究的结果令人鼓舞。此外,与系统交互的用户提供了积极反馈,证明了系统的有效性。

关键词

引用

@article{arxiv.2304.11046,
  title  = {Affective social anthropomorphic intelligent system},
  author = {Md. Adyelullahil Mamun and Hasnat Md. Abdullah and Md. Golam Rabiul Alam and Muhammad Mehedi Hassan and Md. Zia Uddin},
  journal= {arXiv preprint arXiv:2304.11046},
  year   = {2023}
}

备注

Multimedia Tools and Applications (2023)