看,没用手!第一人称视频的智能体-环境因子分解
计算机视觉与模式识别
2023-05-26 v1 机器学习
机器人学
摘要
由于手的遮挡以及人手的视觉差异与机器人末端执行器之间的不匹配,对机器人任务的第一人称视频进行分析和使用具有挑战性。从这个意义上说,人手是一种干扰。然而,手通常也提供有价值的信号,例如手姿可能暗示正握着何种物体。在这项工作中,我们提出提取场景的因子化表示,将智能体(人手)与环境分离。这缓解了遮挡与不匹配问题,同时保留了信号,从而简化了面向下游机器人任务的模型设计。该因子分解的核心是我们提出的基于扩散模型的视频修复(VIDM),它同时利用了真实世界图像的先验(通过大规模预训练扩散模型)和视频较早帧中物体的外观(通过注意力)。我们的实验证明了 VIDM 在提升第一人称视频修复质量方面的有效性,以及我们的因子化表示在众多任务中的威力:物体检测、被操作物体的 3D 重建,以及从视频中学习奖励函数、策略和可及性(affordances)。
引用
@article{arxiv.2305.16301,
title = {Look Ma, No Hands! Agent-Environment Factorization of Egocentric Videos},
author = {Matthew Chang and Aditya Prakash and Saurabh Gupta},
journal= {arXiv preprint arXiv:2305.16301},
year = {2023}
}
备注
for project website with video, see https://matthewchang.github.io/vidm/