听你所愿:基于文本-音频定位的智能城市音频事件检测
声音
2023-12-27 v3 多媒体
音频与语音处理
摘要
随着物联网技术的发展,产生了海量的传感器音频数据,这给智能城市中基于音频的事件检测带来了巨大挑战。在本文中,我们瞄准一项具有挑战性的基于音频的事件检测任务,即文本到音频的定位(text-to-audio grounding)。除了在未裁剪音频中精确本地化所有期望的起始和结束时刻外,这一具有挑战性的新任务还需要广泛的声学和语言理解,以及对音频与查询之间跨模态匹配关系的推理。当前方法通常将查询作为整体通过全局查询表示来处理这些问题。我们认为该策略存在若干缺陷。首先,查询与音频之间的交互未被充分利用。其次,它未区分查询中不同关键词的重要性。此外,由于音频片段长度任意,存在许多与查询无关却未被该方法过滤掉的片段,这进一步阻碍了期望片段的有效定位。受上述关注点启发,我们提出了一种新颖的跨模态图交互(CGI)模型,通过新颖的语言图全面建模查询中词与词之间的关系。为捕获音频与查询间细粒度的相关性,引入了跨模态注意力模块以生成片段特定的查询表示,并自动为具有更重要语义的关键词分配更高权重。此外,我们开发了音频与查询的跨门控模块,以削弱无关部分并强调重要部分。
引用
@article{arxiv.2106.14136,
title = {Listen As You Wish: Audio based Event Detection via Text-to-Audio Grounding in Smart Cities},
author = {Haoyu Tang and Yunxiao Wang and Jihua Zhu and Shuaike Zhang and Mingzhu Xu and Qinghai Zheng and Yupeng Hu},
journal= {arXiv preprint arXiv:2106.14136},
year = {2023}
}
备注
16 pages