中文

LLAVIDAL:用于日常生活活动的大型语言视觉模型

计算机视觉与模式识别 2025-03-27 v3 机器学习

摘要

当前训练于网络视频的大型语言视觉模型 (LLVMs) 在通用视频理解方面表现良好,但在细粒度细节、复杂的人物-物体相互作用 (HOI) 以及视角不变表示学习方面难以胜任,这是日常生活活动 (ADL) 所必需的。这种局限性源于缺乏专门的 ADL 视频指令调优数据集以及不足的模态融合以捕获判别性动作表征。为此,我们提出一种半自动化的数据集构建框架,用于构建 ADL-X,一个多视图、多模态的 RGBS 指令调优数据集。此外,我们引入 LLAVIDAL,一种集成视频、3D 骨架和 HOI 的 LLVM,以建模 ADL 的复杂时空关系。在训练 LLAVIDAL 时,单纯的多模态对齐会导致次优结果;因此,我们提出一种多模态渐进 (MMPro) 训练策略,按照课程方式逐阶段融合各模态。我们还建立了 ADL 选择题和视频描述基准测试,以评估 LLVM 在 ADL 任务中的性能。基于 ADL-X 训练的 LLAVIDAL 在所有 ADL 基准测试中实现了最先进的性能。代码和数据将公开于 https://adl-x.github.io/。

关键词

引用

@article{arxiv.2406.09390,
  title  = {LLAVIDAL: A Large LAnguage VIsion Model for Daily Activities of Living},
  author = {Dominick Reilly and Rajatsubhra Chakraborty and Arkaprava Sinha and Manish Kumar Govind and Pu Wang and Francois Bremond and Le Xue and Srijan Das},
  journal= {arXiv preprint arXiv:2406.09390},
  year   = {2025}
}

备注

CVPR 2025 Camera Ready