Geo-ATBench:面向地理语义上下文的地理空间音频标签基准
音频与语音处理
2026-03-12 v1 机器学习
声音
摘要
环境声理解在计算听觉场景分析 (CASA) 中常被形式化为仅基于音频的识别问题。这种表述在多标签音频标记 (AT) 中留下持久缺陷:声学相似性会使某些事件难以仅凭波形区分。在此类情况下,消除歧义的线索往往存在于波形之外。从地理信息系统数据中提取的地理语义上下文 (GSC),例如点状信息 (POI),提供与位置相关的环境先验信息,可有助于降低这种歧义。通过提出的地理空间音频标记 (Geo-AT) 任务,这一研究方向得以系统化,该任务将 GSC 置于音频之外,对多标签声事件标记进行条件化。为基准化 Geo-AT,引入 Geo-ATBench 作为具地理标注的多音调音频基准,包含 10.71 小时的音频,覆盖 28 个事件类别;每个音频片段配有来自 11 个语义上下文类别的 GSC 表示。提出 GeoFusion-AT 作为统一的地理-音频融合框架,评估特征级、表示级和决策级融合,在代表性音频主干上进行评估,包含仅基于音频和仅基于 GSC 的基线模型。结果表明,纳入 GSC 可提升 AT 性能,尤其在声学混淆标签方面效果显著,表明地理语义在音频之外提供了有效的先验信息。 crowdsourced 听觉研究在 579 样本、10 名参与者处显示,模型在 Geo-ATBench 标签与人类聚合标签之间性能差异无显著区别,支持 Geo-ATBench 作为人类对齐基准。Geo-AT 任务、基准 Geo-ATBench 以及可复现的地理-音频融合框架 GeoFusion-AT 为 CASA 社区研究以地理语义上下文为导向的 AT 提供了基础。数据集、代码和模型均已在主页 (https://github.com/WuYanru2002/Geo-ATBench) 提供。
引用
@article{arxiv.2603.10623,
title = {Geo-ATBench: A Benchmark for Geospatial Audio Tagging with Geospatial Semantic Context},
author = {Yuanbo Hou and Yanru Wu and Qiaoqiao Ren and Shengchen Li and Stephen Roberts and Dick Botteldooren},
journal= {arXiv preprint arXiv:2603.10623},
year = {2026}
}