利用音频表示进行振动基准的体育场观众监测
声音
2025-03-25 v1 计算机视觉与模式识别
摘要
体育场观众监测对于提升公共安全和改善观众体验至关重要。现有方法主要依赖摄像头和麦克风,可能引起显著的干扰,常引发隐私 concerns。本文通过感知地面振动,提供一种更不具扰动性和更非侵入性的群体感知方式,用于预测群体行为。然而,由于振动基准的群体监测方法尚为新开发,主要挑战在于由于体育场是大型公共空间且存在复杂物理活动,缺乏训练数据。本文提出了 ViLA(Vibration Leverage Audio),一种通过预训练无标签跨模态数据来减少对标记数据依赖的振动基准方法。ViLA 首先在无监督方式下对音频数据进行预训练,然后使用最小数量的领域内振动数据进行微调。通过利用公开的音频数据集,ViLA 学习音频中的波动行为,然后将表示适配到振动,从而减少对特定振动数据的依赖。我们的实际实验表明,使用公开的音频数据(YouTube8M)为振动模型预训练,可实现最高达 5.8 倍的误差降低。
引用
@article{arxiv.2503.17646,
title = {Leveraging Audio Representations for Vibration-Based Crowd Monitoring in Stadiums},
author = {Yen Cheng Chang and Jesse Codling and Yiwen Dong and Jiale Zhang and Jiasi Chen and Hae Young Noh and Pei Zhang},
journal= {arXiv preprint arXiv:2503.17646},
year = {2025}
}