基于跨模态监督的视频主动说话人检测学习
计算机视觉与模式识别
2016-03-30 v1
摘要
在本文中,我们展示了如何利用音频来监督视频中主动说话人检测的学习。语音活动检测(VAD)以弱监督方式引导基于视觉的分类器的学习。该分类器使用时空特征来编码上半身运动——与说话相关的面部表情和手势。我们通过学习人物特定模型进一步改进了用于主动说话人检测的通用模型。最后,我们展示了在一个数据集上学习到的通用模型向新数据集中先前未出现的人物进行在线适应,再次使用音频(VAD)进行弱监督。时间连续性的使用克服了缺乏干净训练数据的问题。我们是首个提出一种主动说话人检测系统的团队,该系统在一个音视频数据集上学习,并自动适应新数据集中的说话人。本工作可视为一个示例,说明多模态数据的可用性如何通过将一个模态的知识迁移到另一模态,使我们能够在无需监督的情况下学习模型。
引用
@article{arxiv.1603.08907,
title = {Cross-modal Supervision for Learning Active Speaker Detection in Video},
author = {Punarjay Chakravarty and Tinne Tuytelaars},
journal= {arXiv preprint arXiv:1603.08907},
year = {2016}
}
备注
16 pages