基于区域联合损失的HOT预测:提示引导与人类近距离感知
计算机视觉与模式识别
2025-07-24 v2 人工智能
摘要
人类-物体接触(HOT)检测涉及识别人体特定区域与物体接触的任务。然而,当前模型局限于单一图像类型,往往导致对接触较少区域的分割过度,且难以在特定区域内保持类别一致性。为此,本文提出一种HOT框架,称为P3HOT,融合提示引导与人类近距离感知。首先,利用语义驱动的提示机制,依据图像与文本之间的相关性,引导网络关注相关区域。随后,采用人类近距离感知机制,通过可学习参数动态感知人类周围的关键深度范围,有效消除不太可能发生接触的区域。深度计算解决了二维视角下人类与物体重叠的不确定性,提供了准三维视角。此外,构建了区域联合损失(RJLoss)作为一种新型损失,以抑制同一区域内异常类别。引入一种新评估指标“AD-Acc.”以解决现有方法在处理负样本方面的不足。全面实验结果表明,我们的方法在两个基准数据集上的四项指标中实现了最先进的性能。具体而言,在HOT-Annotated数据集上,模型在SC-Acc.、mIoU、wIoU和AD-Acc.指标上分别实现了0.7分、2.0分、1.6分和11.0分的提升。相关代码已公开于https://github.com/YuxiaoWang-AI/P3HOT。
引用
@article{arxiv.2507.01630,
title = {Prompt Guidance and Human Proximal Perception for HOT Prediction with Regional Joint Loss},
author = {Yuxiao Wang and Yu Lei and Zhenao Wei and Weiying Xue and Xinyu Jiang and Nan Zhuang and Qi Liu},
journal= {arXiv preprint arXiv:2507.01630},
year = {2025}
}
备注
Accepted by ICCV 2025