中文

面向任意视角组合的多模态多视角人类动作识别:对齐与适应

机器学习 2026-02-19 v3

摘要

多模态多视角学习旨在整合来自多样化来源的信息以提升任务性能。现有方法往往难以应对灵活的视角配置,包括任意视角组合、视角数量和异构模态。针对人类动作识别语境,我们提出 AliAd 模型,将多视角对比学习与混合专家模块相结合,以支持训练和推理期间的任意视角可用性。与尝试重建缺失视角不同,使用调整后的中心对比损失进行自监督表征学习和视角对齐,减轻缺失视角对多视角融合的影响。该损失函数允许将视角权重整合以 accounts for 视角质量。此外,它将计算复杂度从 O(V2)O(V^2) 降低至 O(V)O(V),其中 VV 为视角数量。为了解决对比学习无法捕获的残余差异,我们采用混合专家模块并采用专用的负载平衡策略,以适应任意视角组合。我们突出了模型中各组件的几何关系以及它们在潜在空间中的良好组合。AliAd 在包括惯性和人体姿态模态的四个数据集上得到验证,视角数量 ranging 从 3 到 9,展示了其性能和灵活性。

关键词

引用

@article{arxiv.2602.08755,
  title  = {Align and Adapt: Multimodal Multiview Human Activity Recognition under Arbitrary View Combinations},
  author = {Duc-Anh Nguyen and Nhien-An Le-Khac},
  journal= {arXiv preprint arXiv:2602.08755},
  year   = {2026}
}