面向室内移动智能体的多模态多任务场景理解模型
计算机视觉与模式识别
2022-09-28 v1 人工智能
摘要
个性化移动智能体中的感知系统需要开发室内场景理解模型,其可理解三维几何、捕捉客观性、分析人类行为等。然而,相较于室外环境模型(例如包含行人预测、车辆检测、交通标志识别等的自动驾驶系统),该方向尚未被充分探索。本文首先讨论主要挑战:真实世界室内环境标注数据不足甚至缺失,以及其他挑战如异构信息源(如 RGB 图像与激光雷达点云)间的融合、多样化输出集(如三维物体位置、深度估计与人姿)间关系建模,以及计算效率。随后,我们描述 MMISM(多模态输入多任务输出室内场景理解模型)以应对上述挑战。MMISM 将 RGB 图像与稀疏激光雷达点作为输入,将三维目标检测、深度补全、人体姿态估计与语义分割作为输出任务。我们表明 MMISM 表现与单任务模型相当甚至更优;例如,在基准 ARKitScenes 数据集上我们将基线三维目标检测结果提升了 11.7%。
引用
@article{arxiv.2209.13156,
title = {Towards Multimodal Multitask Scene Understanding Models for Indoor Mobile Agents},
author = {Yao-Hung Hubert Tsai and Hanlin Goh and Ali Farhadi and Jian Zhang},
journal= {arXiv preprint arXiv:2209.13156},
year = {2022}
}
备注
Submitted to ICRA2023