中文

Speech-to-See:端到端语音驱动开放集目标检测

声音 2025-09-23 v1 多媒体 音频与语音处理

摘要

音频定位(或语音驱动开放集目标检测)旨在直接从语音中定位和识别目标,使智能体能够在预定义类别之外进行推理。这是人机交互等应用的关键任务。然而,该领域的进展面临来自大规模配对音频-图像数据稀缺性的根本性瓶颈,并且进一步受制于依赖间接、文本中介化管道的先前方法。在本文中,我们引入Speech-to-See(Speech2See),一种基于预训练和微调范式的端到端方法。具体而言,在预训练阶段,我们设计了查询引导语义聚合模块,采用可学习查询将冗余语音嵌入压缩为紧凑语义表示。在微调期,我们引入参数高效的混合专家低秩自适应(Mixture-of-LoRA-Experts, MoLE)架构,以实现更深入和更细致的跨模态适应。大量实验表明,Speech2See在多个基准测试中实现了稳健且具有适应性的性能,显示出强大的泛化能力和广泛的适用性。

关键词

引用

@article{arxiv.2509.16670,
  title  = {Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection},
  author = {Wenhuan Lu and Xinyue Song and Wenjun Ke and Zhizhi Yu and Wenhao Yang and Jianguo Wei},
  journal= {arXiv preprint arXiv:2509.16670},
  year   = {2025}
}