中文

iPay: 基于多模态网络与自适应空间先验学习的集成支付动作识别

计算机视觉与模式识别 2026-05-12 v1 人工智能

摘要

自动化出站支付分析对于可扩展的票价审计和乘客分析至关重要,但实际应用仍依赖有限的手动检查。现有的基于视觉和骨架的方法在噪声较大的 onboard 监控环境下脆弱,往往依赖难以泛化的手工特征。基于图卷积网络在人类动作识别中的成功经验,我们发现骨架特征在建模全局时空依赖性方面表现出色,但倾向于忽略区分支付动作的细微局部相对运动。相比之下,RGB 特征保留了细粒度的空间细节,但在监控录像中往往缺乏可靠的时序连续性。为弥合系统级部署需求与模型级设计挑战,我们提出了 iPay—an 用于 onboard 出站监控系统的集成支付动作识别框架。iPay 采用多模态 mixture-of-experts 架构,包含四个紧密耦合的流:(1) 强调局部证据的 RGB 专家流,通过区域聚焦计算;(2) 基于图卷积 backbone 建模关节运动的骨架专家流;(3) 启用骨架到 RGB 时序迁移和 RGB 到骨架空间增强的双注意力融合流;(4) 基于空间差异判别器 (Spatial Difference Discriminator, SDD) 的先验驱动流,显式建模手部相对锚点的运动,以提高任务特定的判别性。我们还与当地的出站机构合作,收集了超过 55 小时的真实 onboard 监控录像,产生 500+ 个支付剪辑。实验表明,iPay 超越了先前方法,实现了 83.45% 的识别准确率,同时保持竞争的计算效率,适用于边缘部署。代码已公开于 https://github.com/ccoopq/iPay。

关键词

引用

@article{arxiv.2605.10732,
  title  = {iPay: Integrated Payment Action Recognition via Multimodal Networks and Adaptive Spatial Prior Learning},
  author = {Kaicong Huang and Weiheng Oh and Thomas Guggisberg and Ruimin Ke},
  journal= {arXiv preprint arXiv:2605.10732},
  year   = {2026}
}