非本质视频语言模型是否真正理解手-物体交互?
计算机视觉与模式识别
2025-02-21 v3
摘要
非本质视频语言预训练是推进理解第一人称场景中手-物体交互的关键步骤。尽管在现有测试基准上取得了成功,但我们发现当前的EgoVLMs容易被简单修改误导,例如更改交互描述中的动词或名词,模型在区分这些变化方面存在困难。这引出了一个问题:EgoVLMs是否真正理解手-物体交互?为回答此问题,我们引入了一个名为EgoHOIBench的数据集,揭示了当前非本质模型在面对此类挑战时的性能限制。我们将这种性能差距归因于细粒度监督不足以及EgoVLMs在识别动词方面比识别名词更具挑战性。为解决这些问题,我们提出了一种新的非对称对比目标,称为EgoNCE++。对于视频到文本目标,我们通过使用大型语言模型生成负面标题或利用预训练词汇进行HOI相关词汇替换来增强文本监督。对于文本到视频目标,我们关注保持基于对象的特征空间,该特征空间根据共享名词对视频表示进行聚类。广泛的实验结果表明,EgoNCE++显著增强了EgoHOI理解,导致在多实例检索、动作识别和时间理解等各种EgoVLMs任务上实现了改进。我们的代码可在https://github.com/xuboshen/EgoNCEpp获取。
引用
@article{arxiv.2405.17719,
title = {Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions?},
author = {Boshen Xu and Ziheng Wang and Yang Du and Zhinan Song and Sipeng Zheng and Qin Jin},
journal= {arXiv preprint arXiv:2405.17719},
year = {2025}
}
备注
Accepted by ICLR 2025. Code: https://github.com/xuboshen/EgoNCEpp