谁在说话?:真实世界会议的音视频说话人日记化
声音
2019-06-25 v1 计算机视觉与模式识别
音频与语音处理
摘要
本工作的目标是确定真实世界会议中“谁在何时说话”。该方法以环视视频和单通道或多通道音频作为输入,并生成鲁棒的日记化输出。为此,我们提出了一种新颖的迭代方法:首先利用音视频对应性注册说话人模型,然后利用已注册的模型与视觉信息来确定活跃说话人。我们在真实世界会议数据集上展示了强劲的定量与定性性能。该方法还在公开 AMI 会议语料库上进行了评估,结果表明其性能超越所有可比方法。我们还展示了当多通道音频可用时,波束成形可与视频结合使用以进一步提升性能。
引用
@article{arxiv.1906.10042,
title = {Who said that?: Audio-visual speaker diarisation of real-world meetings},
author = {Joon Son Chung and Bong-Jin Lee and Icksang Han},
journal= {arXiv preprint arXiv:1906.10042},
year = {2019}
}
备注
Accepted to Interspeech 2019