中文

CAVEN:一种用于噪声环境下高效音视觉导航的具身对话智能体

计算机视觉与模式识别 2023-12-29 v2 人工智能 计算与语言 机器学习

摘要

智能体朝向音源目标进行音视觉导航是一项具有挑战性的任务,尤其在音频稀疏或环境嘈杂时。本文提出CAVEN,一种基于对话的音视觉具身导航框架,其中智能体可与人类/先知交互以解决导航至音频目标的任务。具体而言,CAVEN被建模为预算感知的部分可观测半马尔可夫决策过程,其隐式学习基于音频的导航策略中的不确定性,以决定智能体何时及如何与先知交互。我们的CAVEN智能体能够进行完全双向自然语言对话,基于音视觉上下文生成相关问题并理解来自先知的自由形式、可能含噪的回复。为实现该能力,CAVEN配备:(i) 基于音视觉线索的轨迹预测网络,用于生成至估计目标的潜在轨迹;(ii) 基于自然语言的问题生成与推理网络,用于向先知提出交互式问题或解读先知回复以生成导航指令。为训练交互模块,我们基于Landmark-RxR数据集提出大规模数据集:AVN-Instruct。为证实对话的效用,我们在SoundSpaces模拟器下多种噪声设置中使用基准音频目标任务进行实验。结果表明,我们的全对话方法在成功率上提升近一个数量级,尤其在定位新声源及对比仅使用单向交互的方法时。

关键词

引用

@article{arxiv.2306.04047,
  title  = {CAVEN: An Embodied Conversational Agent for Efficient Audio-Visual Navigation in Noisy Environments},
  author = {Xiulong Liu and Sudipta Paul and Moitreya Chatterjee and Anoop Cherian},
  journal= {arXiv preprint arXiv:2306.04047},
  year   = {2023}
}

备注

Accepted at AAAI 2024