中文

用于广播节目类型识别的背景跟踪声学特征

声音 2016-11-17 v1

摘要

本文提出了一种提取声学特征的新方法,用于表征录音中的背景环境。这些特征基于对齐输出,该对齐将多个并行的基于背景的受约束最大似然线性回归变换异步拟合至输入音频信号。在此设置下,所得特征能够独立于音频前景中的说话人,跟踪音频背景的变化,如音乐、掌声或笑声的出现与消失。在视听数据中提供此类声学描述的能力具有许多潜在应用,包括广播档案的自动分类或改进自动转录与字幕生成。本文在包含 332 个 BBC 节目的数据集中,探索了这些特征在类型识别任务中的性能。在该任务中,使用高斯混合模型分类器时,所提出的背景跟踪特征优于短时感知线性预测特征(准确率 62% 对 72%)。使用更复杂的分类器,即隐马尔可夫模型和支持向量机,结合新型背景跟踪特征,系统准确率分别提升至 79% 和 81%。

关键词

引用

@article{arxiv.1509.04934,
  title  = {Background-tracking Acoustic Features for Genre Identification of Broadcast Shows},
  author = {Oscar Saz and Mortaza Doulaty and Thomas Hain},
  journal= {arXiv preprint arXiv:1509.04934},
  year   = {2016}
}