中文

神经开放域对话系统对对话历史中语音识别错误的鲁棒性如何?一项实证研究

计算与语言 2020-08-19 v1 人工智能 机器学习

摘要

大型端到端神经开放域聊天机器人正日益流行。然而,构建此类聊天机器人的研究通常假设用户输入为书面性质,且尚不清楚这些聊天机器人能否与自动语音识别(ASR)模型无缝集成以服务于语音模态。我们旨在通过实证研究各种类型合成与真实 ASR 假设在对话历史中对 TransferTransfo(NeurIPS ConvAI2 挑战赛中基于最先进生成式预训练 Transformer(GPT)的神经开放域对话系统)的影响,来引起对这一重要问题的关注。我们观察到,在书面数据上训练的 TransferTransfo 对推理时引入对话历史的此类假设非常敏感。作为一种基线缓解策略,我们在训练期间向对话历史引入合成 ASR 假设,观察到微小改进,表明亟需进一步研究使端到端开放域聊天机器人完全具备语音鲁棒性的技术。据我们所知,这是首个评估合成与真实 ASR 假设对最先进神经开放域对话系统影响的研究,我们希望它将促进把语音鲁棒性作为开放域对话的一项评估标准。

关键词

引用

@article{arxiv.2008.07683,
  title  = {Are Neural Open-Domain Dialog Systems Robust to Speech Recognition Errors in the Dialog History? An Empirical Study},
  author = {Karthik Gopalakrishnan and Behnam Hedayatnia and Longshaokan Wang and Yang Liu and Dilek Hakkani-Tur},
  journal= {arXiv preprint arXiv:2008.07683},
  year   = {2020}
}

备注

Accepted at INTERSPEECH 2020. For dataset, see https://github.com/alexa/Topical-Chat/tree/master/TopicalChatASR/