HumanOmni:面向人类中心视频理解的大型视觉-语音语言模型
计算机视觉与模式识别
2025-01-28 v1
摘要
在人类中心场景中,同时理解视觉和听觉信息至关重要。虽然最近的全模态模型可以处理多种模态,但由于缺乏大规模专业数据集和非针对性的架构,通常在以人类为中心的场景中表现不佳。本文开发了HumanOmni,这是行业首个面向人类中心的全模态大型语言模型。我们构建了一个包含240万个以上人类中心视频剪辑、详细描述和超过1400万条指令的数据集,促进对多样化人类中心场景的理解。HumanOmni包含三个针对不同类型场景的专用分支。它根据用户指令自适应地融合来自这些分支的特征,显著提升了以个人为中心的场景中的视觉理解。此外,HumanOmni集成了音频特征,以确保对环境和个体进行全面理解。我们的实验验证了HumanOmni在多种任务中的先进能力,包括情感识别、面部表情描述和动作理解。我们将向学术界和行业开源该模型,以促进进一步的开发和合作。
引用
@article{arxiv.2501.15111,
title = {HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding},
author = {Jiaxing Zhao and Qize Yang and Yixing Peng and Detao Bai and Shimin Yao and Boyuan Sun and Xiang Chen and Shenghao Fu and Weixuan chen and Xihan Wei and Liefeng Bo},
journal= {arXiv preprint arXiv:2501.15111},
year = {2025}
}