Omni-DeepSearch:面向音频驱动的全模态深度搜索的基准测试
声音
2026-05-12 v1 机器学习
摘要
当前的全模态基准测试主要评估模型在同时提供多种模态的设置下的性能,而仅从音频出发并主动搜索跨模态证据的能力仍未得到充分探索。在本文中,我们引入了 Omni-DeepSearch,一个面向音频驱动的全模态深度搜索的基准测试。给定一个或多个音频片段及相关问题,模型必须从音频中推断出有用线索,调用文本、图像和视频搜索工具,并执行多跳推理以生成简短、客观且可验证的答案。Omni-DeepSearch 包含 640 个样本,涵盖 15 个细粒度类别,涉及四种检索目标模态和四种音频内容类型。一个多阶段过滤流程确保了音频依赖性、检索必要性、视觉模态必要性和答案唯一性。对近期闭源和开源全模态模型的实验表明,该任务仍然极具挑战性:评估中表现最强的模型 Gemini-3-Pro 仅达到 43.44% 的平均准确率。进一步的分析揭示了音频实体推断、查询制定、工具使用可靠性、多跳检索和跨模态验证方面的关键瓶颈。这些结果凸显了音频驱动的全模态深度搜索是未来多模态智能体的一个重要且未被充分探索的方向。
引用
@article{arxiv.2605.08762,
title = {Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search},
author = {Tao Yu and yiming ding and Shenghua Chai and Minghui Zhang and Zhongtian Luo and Xinming Wang and Xinlong Chen and Zhaolu Kang and Junhao Gong and Yuxuan Zhou and Haopeng Jin and Zhiqing Cui and Jiabing Yang and YiFan Zhang and Hongzhu Yi and Zheqi He and Xi Yang and Yan Huang and Liang Wang},
journal= {arXiv preprint arXiv:2605.08762},
year = {2026}
}
备注
43 pages