中文

面向非固定场景下在线适应的基于注意力的说话人命名方法

多媒体 2019-12-03 v1 计算机视觉与模式识别 音频与语音处理

摘要

说话人命名任务旨在查找并识别特定电影或剧集中的活跃说话人,对于自动字幕标注和视频摘要等高级视频分析应用至关重要。现代方法通常利用生物特征结合基于梯度的方法而非基于规则的算法。然而在某些情况下,朴素的基于梯度的方法效率不高。例如,当新角色被加入目标识别列表时,神经网络需要频繁重训以识别新人,这会导致模型准备上的延迟。在本文中,我们提出一种基于注意力的方法,通过在线适应更新新增数据而无需梯度更新过程,从而缩短模型建立时间。我们在说话人命名的多种受控设置下,基于准确率、内存占用和建立时间三项评估指标,对基于注意力的方法与现有基于梯度的方法进行了对比分析。此外,我们将现有说话人命名模型与基于注意力的模型应用于真实视频,证明我们的方法精度与现有最先进模型相当,且在部分情况下更高。

关键词

引用

@article{arxiv.1912.00649,
  title  = {An Attention-Based Speaker Naming Method for Online Adaptation in Non-Fixed Scenarios},
  author = {Jungwoo Pyo and Joohyun Lee and Youngjune Park and Tien-Cuong Bui and Sang Kyun Cha},
  journal= {arXiv preprint arXiv:1912.00649},
  year   = {2019}
}

备注

AAAI 2020 Workshop on Interactive and Conversational Recommendation Systems(WICRS)