基于头部-目标关联的端到端注视目标检测
计算机视觉与模式识别
2024-04-17 v1 人工智能
摘要
精确检测人类注意力所在的对象对于人机交互至关重要,因为它提供了重要线索用于推断人类用户的下一步行动。我们提出了一种用于注视目标检测的端到端方法:预测个体与其注视目标区域之间的头部-目标连接。大多数现有方法使用独立组件(如离线头部检测器)或在建立头部与注视目标之间的关联方面存在问题。相反,我们研究了一种基于输入场景图像的多人注视目标检测框架,集成头部与目标关联 (GazeHTA),用于预测多个头部-目标实例。GazeHTA通过 (1) 利用预训练扩散模型提取场景特征以实现丰富的语义理解, (2) 重新注入头部特征以增强头部先验,提高头部理解效果, (3) 学习连接图作为头部与注视目标之间显式的视觉关联。我们的广泛实验结果表明,GazeHTA在两个标准数据集上均优于最先进的注视目标检测方法和两个改编的基于扩散模型的基线。
引用
@article{arxiv.2404.10717,
title = {Mixed Prototype Consistency Learning for Semi-supervised Medical Image Segmentation},
author = {Lijian Li},
journal= {arXiv preprint arXiv:2404.10717},
year = {2024}
}
备注
15 pages, 2 figures