SocialOmni:面向 Omni 模型的音视频社交互动基准测试
人工智能
2026-03-18 v1
摘要
Omni 模态大语言模型(OLMs)通过原生集成音频、视觉和文本,重新定义了人机交互方式。然而,现有 OLMs 基准测试仍局限于静态、以准确率为导向的任务,缺乏对社交互动能力的评估——这是在自然对话中导航动态线索的核心能力。为此,我们提出了 SocialOmni,一个综合性基准测试,系统化地评估了这种对话式社交互动能力,涵盖三个核心维度:(i)说话者分离与识别(谁在发言),(ii)中断时机控制(何时插话),(iii)自然中断生成(如何表述中断)。SocialOmni 包含 2000 份感知样本和一套 209 份互动生成实例的质量控制诊断数据集,严格限制时间和情境约束,并配备受控的音视频不一致情境以测试模型鲁棒性。我们对 12 家领先的 OLMs 进行基准测试,发现不同模型在社交互动能力上存在显著差异。进一步分析表明,模型感知准确率与其生成情境恰当中断的能力之间存在显著脱节,表明仅凭理解导向指标不足以刻画对话式社交能力。更鼓舞人心的是,SocialOmni 提供的诊断信号可为未来 OLMs 在感知-互动鸿沟上提供可操作的指引。
引用
@article{arxiv.2603.16859,
title = {SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models},
author = {Tianyu Xie and Jinfa Huang and Yuexiao Ma and Rongfang Luo and Yan Yang and Wang Chen and Yuhui Zeng and Ruize Fang and Yixuan Zou and Xiawu Zheng and Jiebo Luo and Rongrong Ji},
journal= {arXiv preprint arXiv:2603.16859},
year = {2026}
}
备注
Code is available at https://github.com/MAC-AutoML/SocialOmni and dataset is available at https://huggingface.co/datasets/alexisty/SocialOmni