中文

HopaDIFF:面向多人场景指称式人体动作分割的全局-局部感知傅里叶条件扩散

计算机视觉与模式识别 2025-10-06 v2 机器学习 多媒体 机器人学 图像与视频处理

摘要

动作分割是高层视频理解的核心挑战,旨在将未剪辑视频分割为片段并从预定义动作集中为每个片段分配标签。现有方法主要处理具有固定动作序列的单人活动,忽略了多人场景。在本工作中,我们开创了多人设置中的文本参考引导人体动作分割,即通过文本描述指定分割的目标人物。我们提出了第一个指称式人体动作分割数据集RHAS133,该数据集由133部电影构建,标注了137个细粒度动作,包含33小时视频数据以及该新任务的文本描述。在RHAS133上使用VLM特征提取器对现有动作分割方法进行基准测试,揭示了有限的性能和对目标人物视觉线索的较差聚合。为解决此问题,我们提出了全局-局部感知傅里叶条件扩散框架HopaDIFF,利用一种新颖的跨输入门控注意力xLSTM增强全局-局部长程推理,以及一种新颖的傅里叶条件引入更细粒度的控制以改善动作分割生成。HopaDIFF在RHAS133的多样化评估设置中取得了最先进结果。数据集和代码可在https://github.com/KPeng9510/HopaDIFF获取。

关键词

引用

@article{arxiv.2506.09650,
  title  = {HopaDIFF: Holistic-Partial Aware Fourier Conditioned Diffusion for Referring Human Action Segmentation in Multi-Person Scenarios},
  author = {Kunyu Peng and Junchao Huang and Xiangsheng Huang and Di Wen and Junwei Zheng and Yufan Chen and Kailun Yang and Jiamin Wu and Chongqing Hao and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:2506.09650},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025. The dataset and code are available at https://github.com/KPeng9510/HopaDIFF