从联合音视频分析中学习类词单元
计算与语言
2017-05-26 v3 计算机视觉与模式识别
摘要
给定一组图像和口语音频字幕,我们提出一种方法,用于在连续语音信号中发现类词的声学单元,并将其扎根于语义相关的图像区域。例如,我们的模型能够检测话语中“lighthouse”一词的口语实例,并将其与包含灯塔的图像区域关联起来。我们不使用任何常规自动语音识别形式,也不使用任何文本转写或常规语言标注。我们的模型有效实现了一种口语习得形式,其中计算机不仅学会通过声音识别词类,还通过将所学词语扎根于图像来丰富其语义。
引用
@article{arxiv.1701.07481,
title = {Learning Word-Like Units from Joint Audio-Visual Analysis},
author = {David Harwath and James R. Glass},
journal= {arXiv preprint arXiv:1701.07481},
year = {2017}
}