中文

面向真实场景说话人日记化的后期音视频融合

音频与语音处理 2023-09-28 v2 计算与语言 声音

摘要

说话人日记化在受限音频上已有充分研究,但在极具挑战的真实场景视频中鲜有探索,此类视频具有说话人更多、语句更短、屏幕内说话人不一致的特点。我们提出一种音视频日记化模型,通过后期融合结合纯音频与以视觉为中心的子系统,以弥补此不足。在音频方面,我们表明基于吸引子的端到端系统(EEND-EDA)在使用我们提出的模拟代理数据集训练方案时表现极为优异,并提出了改进版本EEND-EDA++,其在解码中使用注意力、在训练中使用说话人识别损失以更好应对更多说话人的情况。以视觉为中心的子系统利用面部属性与唇音同步来估计屏幕内说话人的身份与语音活动。两个子系统均大幅超越当前最优(SOTA),融合的音视频系统在AVA-AVD基准上取得了新的SOTA。

关键词

引用

@article{arxiv.2211.01299,
  title  = {Late Audio-Visual Fusion for In-The-Wild Speaker Diarization},
  author = {Zexu Pan and Gordon Wichern and François G. Germain and Aswin Subramanian and Jonathan Le Roux},
  journal= {arXiv preprint arXiv:2211.01299},
  year   = {2023}
}