面向开放世界的人类动作分割:基于图卷积网络的方法
计算机视觉与模式识别
2025-12-12 v2 机器人学
摘要
人类-物体交互分割是日常活动理解的基本任务,在助助机器人、医疗和自主系统等应用中发挥着关键作用。目前大多数基于学习的方法在封闭世界动作分割方面表现优异,但在 novel action 出现的开放场景中难以泛化。由于人类活动的动态多样性,收集用于训练的详尽动作类别是不可行的,亟需一种无需手动标注即可检测和分割离群动作的模型。为此,我们正式定义了开放世界动作分割问题,并提出了一种用于检测和分割未知动作的结构化框架。该框架引入了三个关键创新:1)一种增强型金字塔图卷积网络(EPGCN),配备新型解码器模块以实现鲁棒的时空特征上采样;2)基于 Mixup 的训练,用于综合离群数据,消除对手动标注的依赖;3)一种新型时序聚类损失,将分布内动作聚类,同时远离分布外样本。我们在两个具有挑战性的人类-物体交互识别数据集上评估了该框架:Bimanual Actions 和 2 Hands and Object(H2O)数据集。实验结果表明,在多个开放集合评估指标上,相较于最先进的动作分割模型,本框架在开放集合分割(F1@50)和离群检测性能(AUROC)方面分别实现了 16.9% 和 34.6% 的相对提升。此外,我们进行了深入的消融研究,以评估每个提议组件的影响,确定了开放世界动作分割的最佳框架配置。
引用
@article{arxiv.2507.00756,
title = {Towards Open-World Human Action Segmentation Using Graph Convolutional Networks},
author = {Hao Xing and Kai Zhe Boey and Gordon Cheng},
journal= {arXiv preprint arXiv:2507.00756},
year = {2025}
}
备注
8 pages, 3 figures, accepted in IROS25, Hangzhou, China