中文

看、听与学习——用于说话人识别的多模态 LSTM

机器学习 2016-02-16 v1

摘要

说话人识别指的是在视频中定位与正在进行的语音具有相同身份的人脸的任务。该任务不仅需要对视觉和听觉信号进行联合感知,对严重质量退化和无约束内容变化的鲁棒性处理也是必不可少的。本文描述了一种新颖的多模态长短期记忆(LSTM)架构,它从每个序列输入的开始就无缝统一了视觉和听觉模态。核心思想是通过不仅跨时间步共享权重,而且跨模态共享权重来扩展传统的 LSTM。我们表明,对跨人脸和语音的时间依赖性进行建模可以显著提高对内容质量退化和变化的鲁棒性。我们还发现我们的多模态 LSTM 对干扰项(即非说话身份)具有鲁棒性。我们将多模态 LSTM 应用于 The Big Bang Theory 数据集,并表明我们的系统在说话人识别中优于最先进的系统,具有更低的误报率和更高的识别准确率。

关键词

引用

@article{arxiv.1602.04364,
  title  = {Look, Listen and Learn - A Multimodal LSTM for Speaker Identification},
  author = {Jimmy Ren and Yongtao Hu and Yu-Wing Tai and Chuan Wang and Li Xu and Wenxiu Sun and Qiong Yan},
  journal= {arXiv preprint arXiv:1602.04364},
  year   = {2016}
}

备注

The 30th AAAI Conference on Artificial Intelligence (AAAI-16)