学习在视觉上连接动作及其效果
计算机视觉与模式识别
2024-07-29 v3 人工智能
机器学习
机器人学
摘要
我们引入了视觉连接动作及其效果(CATE)这一视频理解中的新概念。CATE可应用于任务规划和从演示中学习等领域。我们识别并探索了CATE概念的两个不同方面:动作选择(AS)和效果亲和性评估(EAA),其中视频理解模型分别在语义层面和细粒度层面连接动作和效果。我们为AS和EAA设计了各种基线模型。尽管任务具有直观性,但我们观察到模型表现困难,而人类则大幅领先。我们的实验表明,在解决AS和EAA时,模型学习了直观的属性,如目标跟踪和姿态编码,而无需显式监督。我们证明CATE可以成为从无标签视频中学习视频表示的有效自监督任务。本研究旨在展示CATE的基础性和通用性,以期激发更高级的公式和模型。
引用
@article{arxiv.2401.10805,
title = {Learning to Visually Connect Actions and their Effects},
author = {Paritosh Parmar and Eric Peh and Basura Fernando},
journal= {arXiv preprint arXiv:2401.10805},
year = {2024}
}