用于改进口语内容机器理解的层次化注意力模型
计算与语言
2017-01-03 v3
摘要
多媒体或口语内容比纯文本内容呈现更具吸引力的信息,但前者更难在屏幕上展示并由用户选择。因此,对于人类而言,访问前者的大型集合比后者更加困难且耗时。因此,开发能够自动理解口语内容并总结关键信息以供人类浏览的机器极具吸引力。在此努力下,最近提出了一项新的口语内容机器理解任务。其初始目标被定义为托福听力理解测试,这是一项针对母语非英语的英语学习者的挑战性学术英语考试。此前还提出了一种基于注意力的多跳循环神经网络(AMRNN)架构用于此任务,但该架构仅考虑了语音话语内的顺序关系。在本文中,我们提出了一种新的层次化注意力模型(HAM),该模型在话语的树状结构表示而非顺序表示上构建了多跳注意力机制。获得了相对于自动语音识别(ASR)错误具有鲁棒性的改进理解性能。
引用
@article{arxiv.1608.07775,
title = {Hierarchical Attention Model for Improved Machine Comprehension of Spoken Content},
author = {Wei Fang and Jui-Yang Hsu and Hung-yi Lee and Lin-Shan Lee},
journal= {arXiv preprint arXiv:1608.07775},
year = {2017}
}
备注
Copyright 2016 IEEE. Published in the 2016 IEEE Workshop on Spoken Language Technology (SLT 2016)