高速视觉提升零样本语义人类动作理解
计算机视觉与模式识别
2026-05-04 v1 机器人学
摘要
从视觉观察中理解人类动作是人机交互的关键任务,尤其是在需要对不熟悉或难以标注的动作进行语义解释时。对于快速且不常见的活动场景,收集足够的标注数据进行监督学习具有挑战,使零样本方法成为无需任务特定训练的语义理解的实用替代方案。尽管近期大规模预训练模型促进了此类零样本推理,但temporal resolution(尤其是对于快速和细粒度运动)的影响仍未得到充分探讨。本研究探究了temporal resolution如何影响高速人类动作的零样本语义理解。以kendo作为快速和细微运动模式的代表案例,本文提出一种无训练的管道,将预训练视频语言模型用于语义表示,结合大语言模型进行成对动作比较。通过在多个帧率(120 Hz、60 Hz和30 Hz)下的受控实验表明,更高的temporal resolution显著改善了零样本设置下的语义可分性。我们进一步分析了在full和partial观察场景下,基于跟踪的人类关节信息的作用。定量评估采用最近类原型策略,表明高速视频为快速动作提供更稳定和可解释的语义表示。这些发现凸显了temporal resolution在无训练动作识别中的重要性,表明高速感知可增强语义理解能力。
引用
@article{arxiv.2605.00496,
title = {High-Speed Vision Improves Zero-Shot Semantic Understanding of Human Actions},
author = {Yongpeng Cao and Yuji Yamakawa},
journal= {arXiv preprint arXiv:2605.00496},
year = {2026}
}