HAIC:通过更优的描述文本改善多模态大语言模型的人类动作理解与生成
计算机视觉与模式识别
2025-06-10 v2 计算与语言
多媒体
摘要
近期多模态大语言模型(MLLMs)在视频理解方面取得了巨大进展。然而,由于缺乏高质量数据,它们在涉及人类动作的视频上的表现仍然受限。为了解决这一问题,我们引入了一个两阶段数据标注流水线。首先,我们设计了从互联网收集包含清晰人类动作的视频的策略。其次,视频以标准化的描述格式进行标注,该格式使用人类属性来区分个体,并按时间顺序详细描述他们的动作与交互。通过这一流水线,我们构建了两个数据集,即 HAICTrain 和 HAICBench。HAICTrain 包含由 Gemini-Pro 生成并经验证用于训练目的的 126K 个视频-文本对。同时,HAICBench 包含 412 个手动标注的视频-文本对和 2,000 个问答对,用于全面评估人类动作理解。实验结果表明,使用 HAICTrain 进行训练不仅显著提升了 4 个基准测试上的人类理解能力,还能改善文本到视频的生成结果。HAICTrain 和 HAICBench 均已在 https://huggingface.co/datasets/KuaishouHAIC/HAIC 发布。
引用
@article{arxiv.2502.20811,
title = {HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models},
author = {Xiao Wang and Jingyun Hua and Weihong Lin and Yuanxing Zhang and Fuzheng Zhang and Jianlong Wu and Di Zhang and Liqiang Nie},
journal= {arXiv preprint arXiv:2502.20811},
year = {2025}
}