深度多模态说话人命名
计算机视觉与模式识别
2015-07-20 v1 机器学习
多媒体
声音
摘要
自动说话人命名是在电视/电影/直播视频中定位并识别每个说话角色的问题。这是一个具有挑战性的问题,主要归因于其多模态性质,即仅人脸线索不足以获得良好性能。此前针对该问题的多模态方法通常单独处理不同模态的数据,并使用手工启发式方法融合它们。此类方法在简单场景中表现良好,但对于外观变化较大的说话人无法实现高性能。本文提出一种基于卷积神经网络(CNN)的新颖学习框架,自动学习人脸与音频线索的融合函数。我们展示,在不使用人脸跟踪、面部标志点定位或字幕/转录的情况下,我们的系统凭借鲁棒的多模态特征提取,能够在两个不同电视剧上达到最先进的说话人命名性能。我们的算法数据集与实现已在线公开。
引用
@article{arxiv.1507.04831,
title = {Deep Multimodal Speaker Naming},
author = {Yongtao Hu and Jimmy Ren and Jingwen Dai and Chang Yuan and Li Xu and Wenping Wang},
journal= {arXiv preprint arXiv:1507.04831},
year = {2015}
}