利用基于 Transformer 的多传感器融合进行多视角与多模态事件检测
音频与语音处理
2022-02-21 v1 声音
摘要
我们应对一项具有挑战性的任务:多视角与多模态事件检测,该任务利用来自分布式摄像头和麦克风的数据及其弱标签,检测大范围真实环境中的事件。在此任务中,分布式传感器被互补地利用,以捕获单个传感器难以捕获的事件,例如人们在复杂房间内移动的一系列动作,或者房间内相距较远的人之间的交流。为了使传感器在这种情况下能够有效协作,系统应该能够在传感器之间交换信息,并以互补的方式组合有助于识别事件的信息。针对这种机制,我们提出了一种基于 Transformer 的多传感器融合 (MultiTrans),它根据不同视角和模态特征之间的关系来组合多传感器数据。在使用为此任务新收集的数据集进行的实验中,我们使用 MultiTrans 的提出方法提升了事件检测性能,并优于对比方法。
引用
@article{arxiv.2202.09124,
title = {Multi-view and Multi-modal Event Detection Utilizing Transformer-based Multi-sensor fusion},
author = {Masahiro Yasuda and Yasunori Ohishi and Shoichiro Saito and Noboru Harada},
journal= {arXiv preprint arXiv:2202.09124},
year = {2022}
}
备注
5 pages, 5 figures, to appear in IEEE ICASSP 2022