中文

多任务学习框架下声学事件标注对场景分类的影响

声音 2022-06-28 v1 人工智能 机器学习 音频与语音处理 信号处理

摘要

声学事件是具有明确时频特征、且可关联到产生它们的物理对象的声音。声学场景是此类声学事件在无特定时间顺序下的集合。鉴于事件与场景间的这种自然联系,一种普遍看法是,对事件分类的能力必有助于场景分类。这导致了若干尝试利用多任务网络在声学事件标注(AET)与声学场景分类(ASC)上均表现良好的努力。然而,在这些努力中,一项任务的改进并不保证另一项的改进,表明ASC与AET之间存在张力。目前尚不清楚AET的改进是否会转化为ASC的改进。我们通过一项广泛的实证研究探索这一难题,并表明在特定条件下,在多任务网络中以AET作为辅助任务可一致地改进ASC性能。此外,ASC性能随AET数据集规模进一步提升,且对AET数据集中事件的选择或事件数量不敏感。我们得出结论:ASC性能的这一改进源于使用AET的正则化效应,而非源于网络辨别声学事件能力的提升。

关键词

引用

@article{arxiv.2206.13476,
  title  = {Impact of Acoustic Event Tagging on Scene Classification in a Multi-Task Learning Framework},
  author = {Rahil Parikh and Harshavardhan Sundar and Ming Sun and Chao Wang and Spyros Matsoukas},
  journal= {arXiv preprint arXiv:2206.13476},
  year   = {2022}
}

备注

Accepted at ISCA Interspeech 2022