中文

重新思考视频人物-物体交互:基于时间的集合预测用于统一检测与预测

计算机视觉与模式识别 2026-04-14 v1 人工智能

摘要

基于视频的人物-物体交互(HOI)理解需要同时检测正在进行的交互并预测其未来演化。然而,现有方法通常将预测视为构建于外部构造的人物-物体对之上的下游预测任务,限制了检测与预测之间的联合推理。此外,当前基准数据集中的稀疏关键帧标注会导致名义未来标签与实际未来动态在时间上产生错位,降低了预测评估的可靠性。为解决这些问题,我们引入了DETAnt-HOI,这是一个源自VidHOI和Action Genome的时序校正基准,用于更可靠的多时段评估;以及HOI-DA,这是一个以对为中心的框架,联合执行主体-客体定位、当前HOI检测和未来预测,通过将未来交互建模为当前对状态的残差过渡来实现。实验表明,在检测和预测方面均取得一致的改进,长时间尺度的提升更为显著。我们的结果表明,预测在将其作为对层级视频表示学习中的结构约束,联合学习时最为有效。该基准和代码将公开提供。

关键词

引用

@article{arxiv.2604.10397,
  title  = {Rethinking Video Human-Object Interaction: Set Prediction over Time for Unified Detection and Anticipation},
  author = {Yuanhao Luo and Di Wen and Kunyu Peng and Ruiping Liu and Junwei Zheng and Yufan Chen and Jiale Wei and Rainer Stiefelhage},
  journal= {arXiv preprint arXiv:2604.10397},
  year   = {2026}
}

备注

17 pages, 8 figures, code will be publicly available