Omni-MMSI:迈向身份属性标注的社交交互理解
计算机视觉与模式识别
2026-04-02 v1
摘要
我们引入了Omni-MMSI,一个需要从原始音频、视觉和语音输入进行综合社交交互理解的新任务。该任务涉及感知身份属性标注的社交线索(例如,谁在说什么)并推理社交交互(例如,说话者指的是谁)。该任务对于开发能够感知和响应人类交互的AI助手至关重要。与先前基于oracle预处理社交线索的研究不同,Omni-MMSI反映了AI助手必须从原始数据感知和推理的现实场景。然而,现有的流水线和多模态LLMs在Omni-MMSI上表现不佳,因为它们缺乏可靠的身份属性标注能力,从而导致不准确的社交交互理解。为应对这一挑战,我们提出了Omni-MMSI-R,一个参考引导的流水线,通过工具生成身份属性标注的社交线索并进行思维链社交推理。为支持该流水线,我们构建了参与者级别的参考对,并在现有数据集上整理了推理注释。实验表明,Omni-MMSI-R在Omni-MMSI上超越了先进的LLMs和对比方法。项目页面:https://sampson-lee.github.io/omni-mmsi-project-page.
引用
@article{arxiv.2604.00267,
title = {Omni-MMSI: Toward Identity-attributed Social Interaction Understanding},
author = {Xinpeng Li and Bolin Lai and Hardy Chen and Shijian Deng and Cihang Xie and Yuyin Zhou and James Matthew Rehg and Yapeng Tian},
journal= {arXiv preprint arXiv:2604.00267},
year = {2026}
}
备注
Accepted to CVPR 2026. Project page: https://sampson-lee.github.io/omni-mmsi-project-page