面向弱监督关键点发现的 LMPNet
人机交互
2025-07-04 v1 人工智能
摘要
本文探讨了仅受类别标签弱监督的语义对象关键点发现任务。通过将判别式训练的中间层滤波器转化为关键点检测器来实现。我们首先识别了关键点检测器的三个首选特征:(i) 稀疏的空间激活,(ii) 一致性,和 (iii) 多样性。而不依赖于手工设计的损失项,提出一种新型计算效率高的漏透 max 池化 (LMP) 层,显式鼓励最终卷积层滤波器学习“不可重复的局部模式”,这些模式与对象关键点良好对齐。依据可视化结果,提出一种简单而有效的选择策略,以确保滤波器激活的一致性,并应用注意力掩码以强制网络将注意力分布在整个对象上,而不仅仅是最具辨识度的区域。对于最终的关键点预测,提出可学习的聚类层,将关键点提案分组为关键点预测。最终模型命名为 LMPNet,具有高度可解释性,因为它直接操作网络滤波器以检测预定义概念。我们的实验表明,LMPNet 能:(i) 自动发现对对象姿态鲁棒的语义关键点,和 (ii) 实现与监督姿态估计算法相当的强预测精度。
引用
@article{arxiv.2507.02306,
title = {Synthetic Heuristic Evaluation: A Comparison between AI- and Human-Powered Usability Evaluation},
author = {Ruican Zhong and David W. McDonald and Gary Hsieh},
journal= {arXiv preprint arXiv:2507.02306},
year = {2025}
}