中文

由场景语义上下文引导的声音事件检测

声音 2022-02-18 v3

摘要

一些研究已揭示场景的上下文(如“家庭”、“办公室”和“烹饪”)有利于声音事件检测(SED)。移动设备和传感技术可在不使用声学信号的情况下为SED提供有用的场景信息。然而,常规方法在推理阶段只能使用预定义上下文,而不能使用未定义上下文。这是因为此类常规方法利用预定义场景的one-hot表示作为先验上下文。为缓解该问题,我们提出场景知情的SED,其中预定义的场景无关上下文可用于更准确的SED。在所提方法中,利用了预训练的大规模语言模型,使得SED模型在推理阶段能够使用未见过的场景语义上下文。此外,我们研究了场景上下文的语义表示对SED的有用程度。使用TUT Sound Events 2016/2017和TUT Acoustic Scenes 2016/2017数据集进行的实验结果表明,与常规的基于Conformer和CNN–BiGRU的SED相比,所提方法分别将微平均和宏平均F值提高了4.34和3.13个百分点。

关键词

引用

@article{arxiv.2110.03243,
  title  = {Sound Event Detection Guided by Semantic Contexts of Scenes},
  author = {Noriyuki Tonami and Keisuke Imoto and Ryotaro Nagase and Yuki Okamoto and Takahiro Fukumori and Yoichi Yamashita},
  journal= {arXiv preprint arXiv:2110.03243},
  year   = {2022}
}

备注

Accepted to ICASSP 2022