AVLEN:三维环境中的视听语言具身导航
计算机视觉与模式识别
2022-10-17 v1 人工智能
计算与语言
机器学习
摘要
近年来,具身视觉导航在两个不同方向取得进展:(i)使AI智能体能够遵循自然语言指令,以及(ii)使可导航世界多模态化,例如视听导航。然而,真实世界不仅多模态,而且常常复杂,因此尽管有这些进展,智能体仍需要理解其动作中的不确定性并寻求指令以进行导航。为此,我们提出AVLEN——一个用于视听语言具身导航(Audio-Visual-Language Embodied Navigation)的交互式智能体。与视听导航任务类似,我们的具身智能体的目标是通过导航三维视觉世界来定位一个音频事件;但智能体也可向人类( oracle)寻求帮助,该协助以自由形式的自然语言提供。为实现这些能力,AVLEN使用多模态分层强化学习主干来学习:(a)高层策略,选择使用音频线索导航或查询 oracle;(b)低层策略,基于其视听与语言输入选择导航动作。策略通过奖励导航任务成功并最小化对 oracle 的查询次数来进行训练。为实证评估AVLEN,我们在SoundSpaces框架上进行了语义视听导航任务的实验。我们的结果表明,赋予智能体求助能力可带来明显的性能提升,尤其在具挑战性的情形下,例如训练期间未闻及该声音或存在干扰声音时。
引用
@article{arxiv.2210.07940,
title = {AVLEN: Audio-Visual-Language Embodied Navigation in 3D Environments},
author = {Sudipta Paul and Amit K. Roy-Chowdhury and Anoop Cherian},
journal= {arXiv preprint arXiv:2210.07940},
year = {2022}
}
备注
Accepted at NeurIPS 2022