Omni-Captioner:面向 Omni 详细感知的数据管道、模型与基准
摘要
对多模态信息的细粒度感知是推进人机交互的关键。鉴于近期在音频视觉技术方面的进展,能够并行处理音频和视频信号的 Omni Language Models (OLMs) 已成为实现更丰富理解与推理的有前景范式。然而,其捕获和描述细粒度细节的能力仍受限探索。本文提出一种系统性、全面性的 Omni 详细感知研究,从数据管道、模型和基准三个维度展开。我们首先识别到当前 OLMs 中 detail 与 hallucination 之间的内在“共生”关系。为此,我们提出 Omni-Detective——一种集成工具调用的 agentic 数据生成管道,自主产出高细节且最小化幻觉的多模态数据。基于 Omni-Detective 生成的数据,我们训练两个描述模型:Audio-Captioner 用于音频细粒度感知,Omni-Captioner 用于音频视觉细粒度感知。在级联评估协议下,Audio-Captioner 在MMAU和MMAR上取得所有开源模型的最佳性能,超越 Gemini 2.5 Flash,性能与 Gemini 2.5 Pro 相当。在现有详细描述基准测试中,Omni-Captioner 在 VDC 上实现新型 state-of-the-art,并在 video-SALMONN 2 测试集上在 detail 与 hallucination 之间取得最佳权衡。鉴于缺乏专门针对 omni 详细感知的基准测试,我们设计 Omni-Cloze——一种用于详细音频、视觉和音频视觉描述的 cloze 式评估,确保对此类详细描述的稳定、高效和可靠评估。实验结果和分析表明,Omni-Detective 在生成高质量详细描述方面有效,而 Omni-Cloze 在评估此类详细描述方面具有优势。
引用
@article{arxiv.2510.12720,
title = {Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception},
author = {Ziyang Ma and Ruiyang Xu and Zhenghao Xing and Yunfei Chu and Yuxuan Wang and Jinzheng He and Jin Xu and Pheng-Ann Heng and Kai Yu and Junyang Lin and Eng Siong Chng and Xie Chen},
journal= {arXiv preprint arXiv:2510.12720},
year = {2026}
}
备注
Accepted by ICLR2026. Open Source at https://github.com/ddlBoJack/Omni-Captioner