面向声感驱动的操控范式:HEAR 框架
机器人学
2026-03-18 v1 人工智能
计算机视觉与模式识别
声音
摘要
虽然近期的视觉-语言-动作 (VLA) 模型开始整合音频,但通常将声音作为静态预执行提示,或仅关注人类语音。这导致在实时声感驱动操控中缺乏关键环境声学状态验证。由于低频更新或系统延迟,关键声音容易被遗漏。开环执行的动作分块进一步加剧了这一问题,形成声学事件在离散音频观测窗口之间的盲区执行间隔。为此,我们正式化视觉-声音-语言-动作 (VSLA) 作为连续控制范式,基于视觉、流式音频、语言和 proprioception,在延迟决策环路中实现连续感知。作为实例,我们引入 HEAR,一个集成四个组件的 VSLA 框架:(i) 具备流式 Historizer 维持执行间隙中的紧凑因果音频上下文;(ii) 从 Omni foundation models 移植的 Envisioner 用于多感官输入推理;(iii) 学习时序动态的音频世界模型 Advancer,通过预测近期音频码实现;以及 (iv) 基于流匹配的 Realizer 策略生成平滑动作块。为解决 VSLA 预训练数据和评估稀缺问题,我们构建 OpenX-Sound 用于预训练,同时推出 HEAR-Bench——首个遵循严格因果时序规则的声感操控基准。我们的结果表明,稳健的声感操控需要因果持久性和显式时序学习。该框架为多感官基础模型提供了实用路径,使机器人能够感知并与动态环境交互。代码与视频已公开于 https://hear.irmv.top。
关键词
引用
@article{arxiv.2603.16086,
title = {Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation},
author = {Chang Nie and Tianchen Deng and Guangming Wang and Zhe Liu and Hesheng Wang},
journal= {arXiv preprint arXiv:2603.16086},
year = {2026}
}