声呐时刻:音频语言模型在音频地理定位中的基准测试
声音
2026-01-07 v1 人工智能
摘要
地理定位旨在推断给定信号的地理起源。在计算机视觉中,地理定位作为组合推理的苛刻基准而存在,并与公共安全相关。相比之下,音频地理定位的进展受到高质量音频-位置配对数据匮乏的制约。为填补这一空白,我们引入了AGL1K,这是首个面向音频语言模型(ALMs)的音频地理定位基准,涵盖72个国家和地区。为了从众包平台中提取可可靠定位的样本,我们提出了音频可定位性(Audio Localizability)指标,用于量化每个录音的信息量,最终得到1444个精选音频片段。对16种ALMs的评估显示,ALMs已经具备了音频地理定位能力。我们发现,封闭源模型大幅优于开源模型,且语言线索通常作为预测的支架起主导作用。我们进一步分析了ALMs的推理轨迹、区域偏差、错误原因以及可定位性指标的可解释性。总体而言,AGL1K建立了音频地理定位的基准,并有望提升ALMs的地理空间推理能力。
引用
@article{arxiv.2601.03227,
title = {The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization},
author = {Ruixing Zhang and Zihan Liu and Leilei Sun and Tongyu Zhu and Weifeng Lv},
journal= {arXiv preprint arXiv:2601.03227},
year = {2026}
}