中文

HAIC:通过更优的描述文本改善多模态大语言模型的人类动作理解与生成

计算机视觉与模式识别 2025-06-10 v2 计算与语言 多媒体

摘要

近期多模态大语言模型(MLLMs)在视频理解方面取得了巨大进展。然而,由于缺乏高质量数据,它们在涉及人类动作的视频上的表现仍然受限。为了解决这一问题,我们引入了一个两阶段数据标注流水线。首先,我们设计了从互联网收集包含清晰人类动作的视频的策略。其次,视频以标准化的描述格式进行标注,该格式使用人类属性来区分个体,并按时间顺序详细描述他们的动作与交互。通过这一流水线,我们构建了两个数据集,即 HAICTrain 和 HAICBench。HAICTrain 包含由 Gemini-Pro 生成并经验证用于训练目的的 126K 个视频-文本对。同时,HAICBench 包含 412 个手动标注的视频-文本对和 2,000 个问答对,用于全面评估人类动作理解。实验结果表明,使用 HAICTrain 进行训练不仅显著提升了 4 个基准测试上的人类理解能力,还能改善文本到视频的生成结果。HAICTrain 和 HAICBench 均已在 https://huggingface.co/datasets/KuaishouHAIC/HAIC 发布。

关键词

引用

@article{arxiv.2502.20811,
  title  = {HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models},
  author = {Xiao Wang and Jingyun Hua and Weihong Lin and Yuanxing Zhang and Fuzheng Zhang and Jianlong Wu and Di Zhang and Liqiang Nie},
  journal= {arXiv preprint arXiv:2502.20811},
  year   = {2025}
}