DETACH:面向非中心视频和环境传感器的分解时空对齐框架
计算机视觉与模式识别
2025-12-24 v1 人工智能
摘要
将中心视频与可穿戴传感器对齐已显示出人类动作识别的潜力,但在用户不适、隐私 concerns 和可扩展性方面存在实际限制。我们探索了非中心视频与环境传感器作为替代方案。虽然先前的中心视频-可穿戴工作主要采用全局对齐通过编码整个序列为统一表示,但在非中心-环境设置下无法解决两个问题:(P1) 无法捕捉细微运动等局部细节,(P2) 过度依赖于模态不变的时间模式,导致具有相似时间模式但不同时空语义情境的动作之间出现误对齐。为解决这些问题,我们提出了DETACH框架,通过显式分解保留局部细节,同时通过在线聚类发现的新型传感器-空间特征为上下文感知对齐提供语义 grounding。为对齐分解特征,我们采用两阶段方法,通过互相监督建立空间对应关系,然后通过空间-时空加权对比损失进行时序对齐,该损失能够自适应处理难负例、易负例和假负例。在Opportunity++和HWU-USP数据集上的下游任务实验表明,我们的方法相对于调整后的中心视频-可穿戴基线方法取得了显著的改进。
引用
@article{arxiv.2512.20409,
title = {DETACH : Decomposed Spatio-Temporal Alignment for Exocentric Video and Ambient Sensors with Staged Learning},
author = {Junho Yoon and Jaemo Jung and Hyunju Kim and Dongman Lee},
journal= {arXiv preprint arXiv:2512.20409},
year = {2025}
}