中文

剧本化视听内容的说话人日记化

计算与语言 2023-08-07 v1 机器学习

摘要

媒体本地化行业通常需要最终电影或电视制作的对白逐字稿,以便生成外语字幕或配音脚本。具体而言,逐字稿(即播出稿)必须结构化为一系列对白行,每行包含时间码、说话人姓名与转写文本。当前的语音识别技术减轻了转写步骤的负担。然而,最先进的说话人日记化模型在电视节目上仍表现不佳,主要有两个原因:(i)无法跟踪大量说话人,(ii)检测频繁说话人切换的准确率较低。为缓解此问题,我们提出一种新方法,利用拍摄过程中使用的制作脚本提取伪标注数据用于说话人日记化任务。我们提出一种新颖的半监督方法,并在一个66集节目测试集上相对于两个无监督基线模型在我们的指标上展示了51.7%的相对提升。

关键词

引用

@article{arxiv.2308.02160,
  title  = {Speaker Diarization of Scripted Audiovisual Content},
  author = {Yogesh Virkar and Brian Thompson and Rohit Paturi and Sundararajan Srinivasan and Marcello Federico},
  journal= {arXiv preprint arXiv:2308.02160},
  year   = {2023}
}

备注

5 pages, 3 figures