问还是不问?视觉语言导航中信息缺失的检测
人工智能
2024-11-12 v1 计算机视觉与模式识别
摘要
视觉语言导航(VLN)领域的最新研究忽视了智能体提问能力的发展,即智能体在指令不完整时提出澄清性问题的能力。本文探讨了智能体如何识别其何时缺乏足够信息,而不关注缺失了“什么”,特别是在指令模糊的VLN任务中。赋予智能体这种能力可以通过减少潜在偏离并及时寻求帮助来提高效率。识别此类不确定点的挑战在于在过度谨慎(高召回率)和过度自信(高精确率)之间取得平衡。我们提出了一种基于注意力的指令模糊性估计模块,用于学习指令与智能体轨迹之间的关联。通过在训练中利用指令到路径的对齐信息,该模块的模糊性估计性能在精确率-召回率平衡方面提升了约52%。在消融实验中,我们还证明了在导航模块中结合该额外的指令到路径注意力网络与跨模态注意力网络的有效性。结果表明,指令到路径注意力网络的注意力分数是估计模糊性的更好指标。
引用
@article{arxiv.2411.05831,
title = {To Ask or Not to Ask? Detecting Absence of Information in Vision and Language Navigation},
author = {Savitha Sam Abraham and Sourav Garg and Feras Dayoub},
journal= {arXiv preprint arXiv:2411.05831},
year = {2024}
}
备注
Accepted at WACV 2025