利用增强语义的动态评分实现免训练的人-物交互检测
计算机视觉与模式识别
2025-07-24 v1
摘要
人-物交互(HOI)检测旨在识别图像中的人和物体,并解读它们之间的交互。现有的HOI方法严重依赖带有手动标注的大型数据集,从视觉线索中学习交互。这些标注制作耗时、容易不一致,并且限制了向新领域和罕见交互的可扩展性。我们认为,视觉-语言模型(VLM)的最新进展提供了尚未开发的潜力,特别是在增强交互表示方面。尽管先前的工作已经注入了这种潜力,甚至提出了免训练的方法,但仍然存在关键差距。因此,我们提出了一种新颖的免训练HOI检测框架——具有增强语义的动态评分(DYSCO),它有效地利用了多模态注册表中的文本和视觉交互表示,实现了鲁棒且细致的交互理解。该注册表包含少量视觉线索,并使用创新的交互签名来改善动词的语义对齐,从而促进对罕见交互的有效泛化。此外,我们提出了一种独特的多头注意力机制,能够自适应地加权视觉和文本特征的贡献。实验结果表明,我们的DYSCO超越了免训练的最先进模型,并且与基于训练的方法具有竞争力,特别是在罕见交互方面表现出色。代码可在https://github.com/francescotonini/dysco获取。
引用
@article{arxiv.2507.17456,
title = {Dynamic Scoring with Enhanced Semantics for Training-Free Human-Object Interaction Detection},
author = {Francesco Tonini and Lorenzo Vaquero and Alessandro Conti and Cigdem Beyan and Elisa Ricci},
journal= {arXiv preprint arXiv:2507.17456},
year = {2025}
}
备注
Accepted to ACM Multimedia 2025