DiaLoc:一种具身对话定位的迭代方法
计算机视觉与模式识别
2024-03-12 v1
摘要
多模态学习提升了许多视觉 - 语言任务的性能。然而,现有的具身对话研究大多集中于导航,而忽视了定位任务。少数现有的基于对话的定位方法假设在定位之前可获得整个对话,这对于部署的基于对话的定位系统而言是不切实际的。在本文中,我们提出了 DiaLoc,这是一种新的基于对话的定位框架,符合真实人类操作员的行为。具体而言,我们产生位置预测的迭代细化,能够在每次对话回合后可视化当前的姿态信念。DiaLoc 有效地利用多模态数据进行多次拍摄定位,其中融合编码器迭代地融合视觉和对话信息。我们在具身对话定位任务上取得了最先进 (SOTA) 的结果,在单次拍摄(Acc5@valUnseen 提升 +7.08%)和多次拍摄设置(Acc5@valUnseen 提升 +10.85%)中均表现优异。DiaLoc 缩小了仿真与现实应用之间的差距,为未来的协同定位与导航研究开辟了道路。
引用
@article{arxiv.2403.06846,
title = {DiaLoc: An Iterative Approach to Embodied Dialog Localization},
author = {Chao Zhang and Mohan Li and Ignas Budvytis and Stephan Liwicki},
journal= {arXiv preprint arXiv:2403.06846},
year = {2024}
}
备注
12 pages, 10 figures, to appear in CVPR 2024