听声思考:音频分类的简单测试时间扩展方法
声音
2025-09-25 v1 人工智能
机器学习
音频与语音处理
摘要
我们提出一种框架,使神经模型在 "听声思考"(thinking while listening)日常声音时能够获得更好的音频分类性能。灵感来自大语言模型推理能力的 recent 进展,我们关注两个核心问题:(i)如何将思考融入现有音频分类管道以启用类别空间中的推理并提升性能;(ii)能否从零设计一种支持思考与测试时间扩展的新架构?我们在两种设置下都证明了我们的模型表现出 improved 分类准确率。通过测试时间扩展,我们观察到随采样轨迹数量增加而持续获得性能提升。此外,我们评估了两个开源推理模型——GPT-OSS-20B 和 Qwen3-14B,结果显示虽然此类模型能够 zero-shot 推理,但一种轻量级方法——仅对冻结的小型模型如 GPT-2 的嵌入矩阵进行 retraining——即可超越 billion 参数文本推理模型的性能。
引用
@article{arxiv.2509.19676,
title = {Thinking While Listening: Simple Test Time Scaling For Audio Classification},
author = {Prateek Verma and Mert Pilanci},
journal= {arXiv preprint arXiv:2509.19676},
year = {2025}
}
备注
6 pages, 3 figures, 2 Tables, ICASSP 2026