中文

STAR-Bench: 探测音频 4D 智能的深层时空推理

声音 2025-12-01 v2 计算与语言 音频与语音处理

摘要

尽管多模态大语言模型和大音频语言模型取得了快速进展,但现有音频基准测试大多测试可从文本标题中恢复的语义,掩盖了对细粒度感知推理的不足。我们正式定义音频 4D 智能作为对声音在时间和三维空间中动态进行推理,并引入 STAR-Bench 来衡量其表现。STAR-Bench 结合了基础声学感知设置(六大属性下的绝对和相对 regimes)以及包含连续与离散过程的段落重排以及空间任务(静态定位、多源关系和动态轨迹)的整体时空推理设置。我们的数据 curated 流程使用两种方法确保高质量样本:针对基础任务,我们使用程序化合成和物理仿真音频;针对整体数据,我们遵循四阶段流程,包括人工标注和基于人类表现的最终筛选。与先前基准测试不同,STAR-Bench 通过 caption-only 回答导致显著下降(-31.5% 时序推理,-35.2% 空间推理),证明其聚焦于难以用语言描述的感知线索。评估 19 个模型后发现,与人类相比仍存在显著差距,呈现能力等级:闭源模型在细粒度感知方面受限,而开源模型在感知、知识和推理方面均落后。STAR-Bench 为开发更具物理世界理解能力的模型提供了关键见解和明确的前进路径。

关键词

引用

@article{arxiv.2510.24693,
  title  = {STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence},
  author = {Zihan Liu and Zhikang Niu and Qiuyang Xiao and Zhisheng Zheng and Ruoqi Yuan and Yuhang Zang and Yuhang Cao and Xiaoyi Dong and Jianze Liang and Xie Chen and Leilei Sun and Dahua Lin and Jiaqi Wang},
  journal= {arXiv preprint arXiv:2510.24693},
  year   = {2025}
}

备注

Homepage: https://internlm.github.io/StarBench/