基于大语言模型跨模态集成的开放词汇人类互动识别 (OV-HHIR)
计算机视觉与模式识别
2025-01-03 v1 机器学习
摘要
理解人类之间的互动,尤其是在公共安全监视等情境中,对于监控和维护安全至关重要。传统的活动识别系统受限于固定词汇、预定义标签和僵化的互动类别,往往依赖于编排视频,忽略了并发的互动群体。这些限制使得系统在面对多样化和不可预测的现实场景时缺乏适应性。本文提出一种开放词汇人类-人类互动识别 (OV-HHIR) 框架,利用大语言模型生成对看见和未看见的人类互动的开放式文本描述,不受固定词汇限制。此外,我们构建了一个全面且大规模的人类-人类互动数据集,通过标准化和整合现有公开人类互动数据集创建统一的基准。大量实验表明,我们的方法优于传统的固定词汇分类系统和现有的跨模态语言模型,用于视频理解,为监视领域及更广泛场景中的更智能和适应性的视觉理解系统铺平了道路。
引用
@article{arxiv.2501.00432,
title = {OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models},
author = {Lala Shakti Swarup Ray and Bo Zhou and Sungho Suh and Paul Lukowicz},
journal= {arXiv preprint arXiv:2501.00432},
year = {2025}
}
备注
Accepted in IEEE ICASSP 2025