中文

一次说话即可看见

计算机视觉与模式识别 2024-10-01 v2

摘要

使用视觉线索对图像中的对象进行 grounding是计算机视觉中一个既定的方法,然而将音频作为对象识别和 grounding的潜在作用力尚未得到充分探索。我们引入YOSS,即"You Only Speak Once to See",以利用音频对图像中的对象进行 grounding,称为音频 grounding。通过将预训练的音频模型与视觉模型集成,使用对比学习和多模态对齐,我们的方法捕获语音命令或描述,并将其直接映射到图像中的相应对象。实验结果表明,音频指导可以有效应用于对象 grounding,表明将音频指导纳入当前对象 grounding方法可能可以提高其精度和鲁棒性,并提升机器人系统和计算机视觉应用的性能。这一发现为先进的对象识别、场景理解以及开发更直观且功能更强的机器人系统开辟了新的可能性。

关键词

引用

@article{arxiv.2409.18372,
  title  = {You Only Speak Once to See},
  author = {Wenhao Yang and Jianguo Wei and Wenhuan Lu and Lei Li},
  journal= {arXiv preprint arXiv:2409.18372},
  year   = {2024}
}

备注

7 pages, 4 figures