第一人称视角下的人-物-人交互:数据集与基准
计算机视觉与模式识别
2025-08-07 v1
摘要
从真实世界的人类中心交互数据集中学习动作模型对于构建高效的通用智能助手至关重要。然而,大多数现有数据集仅提供专门的交互类别,忽视了AI助手基于第一人称获取感知并采取行动的事实。我们主张,通用交互知识与中心模式都是必不可少的。本文将手动辅助任务嵌入视觉-语言-动作框架,其中助手根据中心视觉和命令为指导者提供服务。通过我们的混合RGB-MoCap系统,助手与指导者成对 engage with multiple objects and scene,遵循GPT生成的脚本。在此设置下,我们实现了InterVLA——首个规模为11.4小时、包含120万帧多模态数据的大规模人-物-人交互数据集,涵盖2段中心视频和5段外侧视频,包含精确的人类/物体运动和语言指令。此外,我们在中心人类运动估计、交互合成和交互预测方面建立了新基准,并进行了全面分析。我们相信,InterVLA testbed和基准将推动未来在物理世界中构建AI智能体的工作。
引用
@article{arxiv.2508.04681,
title = {Perceiving and Acting in First-Person: A Dataset and Benchmark for Egocentric Human-Object-Human Interactions},
author = {Liang Xu and Chengqun Yang and Zili Lin and Fei Xu and Yifan Liu and Congsheng Xu and Yiyi Zhang and Jie Qin and Xingdong Sheng and Yunhui Liu and Xin Jin and Yichao Yan and Wenjun Zeng and Xiaokang Yang},
journal= {arXiv preprint arXiv:2508.04681},
year = {2025}
}
备注
Accepted to ICCV 2025. Project Page: https://liangxuy.github.io/InterVLA/