中文

电视剧的视听说话人日记化

多媒体 2019-01-01 v2 计算与语言

摘要

当应用于叙事电影时,说话人日记化可能难以实现,因为说话人通常在不利的声学条件下交谈:背景音乐、音效、语调的广泛变化可能掩盖说话人间的差异,并使基于音频的说话人日记化方法容易出错。另一方面,此类虚构电影在图像层面表现出很强的规律性,尤其是在对话场景中。在本文中,我们提出通过结合音频和视频模态来对电视剧对话场景中的说话人进行日记化:首先使用每种模态分别执行说话人日记化,然后在最优匹配这两个得到的实例集划分之后,最终处理剩余的、对应于两种模态意见不一致的实例。将这种多模态方法应用于虚构电影所获得的结果,优于仅依赖单一模态所得的结果。

关键词

引用

@article{arxiv.1812.07205,
  title  = {Audiovisual speaker diarization of TV series},
  author = {Xavier Bost and Georges Linarès and Serigne Gueye},
  journal= {arXiv preprint arXiv:1812.07205},
  year   = {2019}
}