中文

重挖掘、学习与推理:探索用于语言引导HOI检测的交叉模态语义关联

计算机视觉与模式识别 2023-09-19 v2 人工智能

摘要

人-物交互(HOI)检测是一项具有挑战性的计算机视觉任务,要求视觉模型处理人与物体之间复杂的交互关系并预测HOI三元组。尽管众多交互组合带来了挑战,它们也为视觉文本的多模态学习提供了机遇。本文提出一个系统且统一的框架(RmLR),通过引入结构化文本知识来增强HOI检测。首先,我们定性并定量地分析两阶段HOI检测器中交互信息的丢失,并提出一种重挖掘策略以生成更全面的视觉表示。其次,我们设计了更细粒度的句子级与词级对齐以及知识迁移策略,以有效解决多个交互与多个文本之间多对多的匹配问题。这些策略缓解了多个交互同时发生时的匹配混淆问题,从而提升了对齐过程的效率。最后,由文本知识增强的视觉特征进行HOI推理,显著改善了对交互的理解。实验结果证明了我们方法的有效性,在公开基准上取得了最先进的性能。我们进一步分析了方法中不同组件的作用,以洞察其效能。

关键词

引用

@article{arxiv.2307.13529,
  title  = {Re-mine, Learn and Reason: Exploring the Cross-modal Semantic Correlations for Language-guided HOI detection},
  author = {Yichao Cao and Qingfei Tang and Feng Yang and Xiu Su and Shan You and Xiaobo Lu and Chang Xu},
  journal= {arXiv preprint arXiv:2307.13529},
  year   = {2023}
}

备注

ICCV2023