中文

基于深度学习的视觉场景与话语多模态受话人识别

人工智能 2018-09-13 v1 机器学习

摘要

随着智能系统(如智能音箱)的广泛使用,受话人识别已成为人机交互中的一个关注点,因为越来越多的人期望此类系统能理解复杂的社会场景,包括户外、食堂和医院中的场景。由于以往研究通常仅关注具有有限对话情境(如控制智能家居)的预指定任务,我们创建了一个称为视觉场景与话语受话人识别(ARVSU)的模拟数据集,其中包含大量视觉场景中带有标注话语及对应受话人的图像变化。我们还提出一种基于多模态深度学习的模型,该模型考虑不同人类线索,特别是目光注视与话语语料转写文本,以从特定说话人视角预测各种真实生活对话情境中的对话受话人。据我们所知,我们首次引入了结合视觉与话语转写文本进行受话人识别的端到端深度学习模型。结果表明,我们的研究提示未来受话人识别可具备理解诸多此前未探索社会情境中人类意图的能力,而我们的多模态数据集是推动该领域研究的第一步。

关键词

引用

@article{arxiv.1809.04288,
  title  = {Deep Learning Based Multi-modal Addressee Recognition in Visual Scenes with Utterances},
  author = {Thao Minh Le and Nobuyuki Shimizu and Takashi Miyazaki and Koichi Shinoda},
  journal= {arXiv preprint arXiv:1809.04288},
  year   = {2018}
}

备注

Proceedings of the Twenty-Seventh International Joint Conference on Artificial Intelligence Main track. Pages 1546-1553