HumanVLM:人类-场景视觉语言模型的基础
人工智能
2024-11-06 v1 多媒体
摘要
人类-场景视觉语言任务在各种社会应用中日益普遍,然而最近的进展主要依赖于针对单个任务定制的模型。新兴研究表明,大型视觉语言模型(VLMs)可以提升各种下游视觉语言理解任务的性能。然而,通用领域模型在专业领域通常表现不佳。本研究引入了一个特定领域的大型视觉语言模型——人类-场景视觉语言模型(HumanVLM),旨在为人类-场景视觉语言任务提供基础。具体来说,(1) 我们从互联网构建了一个大规模人类-场景多模态图文数据集(HumanCaption-10M),以促进领域特定的对齐;(2) 开发了一种以人为中心的图像描述方法,捕捉人脸、人体和背景,并构建了一个高质量的人类-场景图文数据集(HumanCaptionHQ,约311k对),其中包含尽可能多的人类细节信息;(3) 使用HumanCaption-10M和HumanCaptionHQ,我们训练了HumanVLM。在实验中,我们在各种下游任务上评估了我们的HumanVLM,结果表明它在规模相当的多模态模型中表现出优越的整体性能,特别是在与人类相关的任务中表现出色,并显著优于包括Qwen2VL和ChatGPT-4o在内的类似模型。HumanVLM及其引入的数据将激发人类相关领域的研究。
引用
@article{arxiv.2411.03034,
title = {HumanVLM: Foundation for Human-Scene Vision-Language Model},
author = {Dawei Dai and Xu Long and Li Yutang and Zhang Yuanhui and Shuyin Xia},
journal= {arXiv preprint arXiv:2411.03034},
year = {2024}
}
备注
34 pages,11 figures