电影中的说话人命名
计算与语言
2018-09-25 v1 计算机视觉与模式识别
摘要
我们提出一种用于电影中说话人命名的新模型,该模型在统一优化框架中利用视觉、文本与声学多模态。为评估模型性能,我们引入一个由《生活大爆炸》六集剧集与十八部涵盖不同题材的完整电影组成的新数据集。实验表明,我们的多模态模型在平均加权 F 值度量上显著优于若干竞争性基线。为展示框架有效性,我们设计了一个端到端记忆网络模型,其利用我们的说话人命名模型,在 MovieQA 2017 挑战的字幕任务上取得最先进结果。
引用
@article{arxiv.1809.08761,
title = {Speaker Naming in Movies},
author = {Mahmoud Azab and Mingzhe Wang and Max Smith and Noriyuki Kojima and Jia Deng and Rada Mihalcea},
journal= {arXiv preprint arXiv:1809.08761},
year = {2018}
}