跨视角协同智能:基于以观点和外观视角的全景调查
计算机视觉与模式识别
2025-06-09 v1
摘要
从 egocentric(第一人称)和 exocentric(第三人称)两个视角感知世界是人类认知的基本能力,能够实现对动态环境的丰富且互补的理解。近年来,使机器人能够利用这两种双重视角的协同潜力的研究方向在视频理解中日益引人关注。本篇调查综述了从 exocentric 和 egocentric 两个视角进行的视频理解。我们首先强调了集成 egocentric 和 exocentric 技术的实际应用场景,展望其在不同领域的潜在协作。随后,我们确定实现这些应用的关键研究任务。接着,我们系统性地组织并综述了近期的研究进展,归纳为三个主要研究方向:(1)利用 egocentric 数据提升 exocentric 理解能力;(2)利用 exocentric 数据改善 egocentric 分析;(3)统一两种视角的联合学习框架。对于每个方向,我们分析了 diverse set of tasks 和相关工作。此外,我们讨论了支持两种视角研究的基准数据集,评估其范围、多样性和适用性。最后,我们讨论了当前工作的局限性,并提出了有前景的未来研究方向。通过综合两种视角的见解,本旨在激发视频理解和人工智能领域的进展,使机器更接近地以类人方式感知世界。相关工作的 GitHub 仓库可在 https://github.com/ayiyayi/Awesome-Egocentric-and-Exocentric-Vision 查阅。
引用
@article{arxiv.2506.06253,
title = {Bridging Perspectives: A Survey on Cross-view Collaborative Intelligence with Egocentric-Exocentric Vision},
author = {Yuping He and Yifei Huang and Guo Chen and Lidong Lu and Baoqi Pei and Jilan Xu and Tong Lu and Yoichi Sato},
journal= {arXiv preprint arXiv:2506.06253},
year = {2025}
}