中文

HOI 分析:使用仅测试集可用的训练自由 multimodal 视觉基础模型方法

计算机视觉与模式识别 2024-08-13 v1 人工智能

摘要

人物-物体相互作用 (HOI) 旨在识别图像中人物与物体的配对,并识别其关系,从而形成 人物,物体,动词\langle 人物, 物体, 动词 \rangle 三元组。在默认设置下,HOI 性能几乎已饱和,许多研究聚焦于长尾分布和零样本/少样本情境。让我们考虑一个引人入胜的问题:“若仅有测试数据集而无训练数据集,如何以训练自由的方式使用多模态视觉基础模型?”本研究采用两种实验设置: grounding truth 与随机任意组合。我们得出了一些有趣的结论,发现多模态视觉基础模型的开放词汇能力尚未完全实现。此外,用 grounding DINO 替代特征提取进一步确认了这些发现。

关键词

引用

@article{arxiv.2408.05772,
  title  = {An analysis of HOI: using a training-free method with multimodal visual foundation models when only the test set is available, without the training set},
  author = {Chaoyi Ai},
  journal= {arXiv preprint arXiv:2408.05772},
  year   = {2024}
}