利用语言模型能力进行声音事件检测
声音
2024-08-06 v2 人工智能
音频与语音处理
摘要
大型语言模型在多模态领域展现出深层理解与流畅生成能力。尽管音频多模态已取得显著进展,现有方法很少利用语言模型进行声音事件检测(SED)。本文提出一种端到端框架,在理解音频特征的同时生成声音事件及其时间位置。具体而言,我们采用预训练声学模型捕捉跨类别的判别性特征,并利用语言模型进行自回归文本生成。常规方法通常难以在纯音频域获取特征用于分类。相比之下,我们的框架利用语言模型灵活理解与时序声学表示对齐的丰富语义上下文。实验结果展示了所提方法在提升时间戳精度与事件分类上的有效性。
引用
@article{arxiv.2308.11530,
title = {Leveraging Language Model Capabilities for Sound Event Detection},
author = {Hualei Wang and Jianguo Mao and Zhifang Guo and Jiarui Wan and Hong Liu and Xiangdong Wang},
journal= {arXiv preprint arXiv:2308.11530},
year = {2024}
}
备注
5 pages, 4 figures, accept by interspeech2024