中文

SONIC-O1:面向音视频理解的多模态大语言模型实用基准

人工智能 2026-05-28 v2 计算机视觉与模式识别

摘要

多模态大语言模型 (Multimodal Large Language Models, MLLMs) 是近期人工智能研究的主要焦点。然而,大多数先前工作聚焦于静态图像理解,而其处理顺序音视频数据的能力尚未得到充分探索。此差距凸显了构建高质量基准以系统评估 MLLM 在真实场景下表现的必要性。我们引入SONIC-O1,一个覆盖13个真实对话领域、包含4,958个注释和人口统计元数据的全人工验证基准,时长60小时(231个片段)。SONIC-O1评估三个能力:开放式摘要、多选题回答和带支持论证的时间局部化。对于不同模型族,发现多选题准确率在模型族之间差距最小,但最佳闭源模型对最佳开源模型在时间局部化方面优势达22.6%。我们进一步观察到在人口统计学群体间进行时间局部化准确率差异可达21.4%,表明模型行为仍存在显著差异。SONIC-O1为基于时间定位和人口统计学鲁健性的多模态理解提供开放评估套件。SONIC-O1已公开供研究使用:项目页面(https://vectorinstitute.github.io/sonic-o1/)、数据集(https://huggingface.co/datasets/vector-institute/sonic-o1)、GitHub(https://github.com/vectorinstitute/sonic-o1)、排行榜(https://huggingface.co/spaces/vector-institute/sonic-o1-leaderboard)。

关键词

引用

@article{arxiv.2601.21666,
  title  = {SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding},
  author = {Ahmed Y. Radwan and Christos Emmanouilidis and Hina Tabassum and Deval Pandya and Shaina Raza},
  journal= {arXiv preprint arXiv:2601.21666},
  year   = {2026}
}