MASH-VLM:通过离散化时空表征消除视频-LLM中的动作-场景幻觉
计算机视觉与模式识别
2025-03-21 v1
摘要
本工作针对Video Large Language Models(Video-LLM)中的动作-场景幻觉问题进行了研究,即模型基于场景上下文错误预测动作,或基于观察到的动作错误预测场景。我们注意到,现有Video-LLM通常因两个主要因素导致动作-场景幻觉:其一,现有Video-LLM通过对所有token应用注意力操作将空间和时间特征交织在一起;其二,他们使用标准的旋转位置编码(RoPE),导致文本token在特定类型的token上过度强调其序列顺序。为解决这些问题,我们引入MASH-VLM,通过离散化时空表征消除Video-LLM中的动作-场景幻觉。我们的方法包含两个关键创新:(1)DST注意力——一种将LLM中的空间和时间token通过使用掩码注意力以限制空间和时间token之间直接相互作用的新注意力机制;(2)Harmonic-RoPE——扩展位置ID的维度,使空间和时间token相对于文本token保持平衡的位置。为评估Video-LLM中的动作-场景幻觉,我们引入了包含1320个视频和4078个问答对的UNSCEAN基准数据集。广泛实验表明,MASH-VLM在UNSCEAN基准以及现有视频理解基准上实现了最先进的成绩。
引用
@article{arxiv.2503.15871,
title = {MASH-VLM: Mitigating Action-Scene Hallucination in Video-LLMs through Disentangled Spatial-Temporal Representations},
author = {Kyungho Bae and Jinhyung Kim and Sihaeng Lee and Soonyoung Lee and Gunhee Lee and Jinwoo Choi},
journal= {arXiv preprint arXiv:2503.15871},
year = {2025}
}
备注
Accepted for CVPR 2025