基于结构化层次预测学习的通用事件部分关系推断
计算机视觉与模式识别
2025-12-05 v1
摘要
人类自然地将连续经验感知为一系列时间上嵌套的事件,以及嵌入更粗糙例程中的细粒度动作。复制这种结构的计算机视觉模型需要能够进行预测性和层次化分割视频,而不仅仅是事后处理。我们引入了PARSE框架,一个从无监督的流式视频中直接学习多尺度事件结构的统一框架。PARSE将感知组织为一层层递归预测器,每层在自己的时间尺度上运行:底层模型短期动态,高层模型通过注意力反馈整合更长期的上下文。事件边界自然地作为预测误差中的瞬时峰值出现,产生与人类事件感知中观察到的包含关系相符的、具有时序一致性的嵌套部分关系。我们在三个基准数据集上进行评估:Breakfast Actions、50 Salads 和 Assembly 101。PARSE在流式方法中实现了最新的性能,同时在时序对齐(H-GEBD)和结构一致性(TED、hF1)方面与离线基线相当。结果表明,在不确定性下的预测学习为通向类人时序抽象和组合事件理解提供了可扩展的路径。
引用
@article{arxiv.2512.04219,
title = {Generalized Event Partonomy Inference with Structured Hierarchical Predictive Learning},
author = {Zhou Chen and Joe Lin and Sathyanarayanan N. Aakur\\},
journal= {arXiv preprint arXiv:2512.04219},
year = {2025}
}
备注
16 pages, 7 figures, 3 tables. Under Review