Speech-Hands:面向语音识别与音频推理的全感知自反思语音智能体方法
声音
2026-05-19 v2 人工智能
计算与语言
多智能体系统
音频与语音处理
摘要
我们引入了一个语音智能体框架,该框架学习一项关键的全方位理解技能:知道何时信任自身以及何时求助于外部音频感知。我们的工作动机源于一个关键且反直觉的发现:在语音识别与外部声音理解任务上对全模型进行朴素微调通常会降低性能,因为模型很容易被噪声假设误导。为解决此问题,我们的框架 Speech-Hands 将问题重新表述为显式的自反思决策。这种可学习的反思原语在防止模型被错误的外部候选所干扰方面证明是有效的。我们表明,这种智能体动作机制能够从语音识别自然地泛化到复杂的多选音频推理。在 OpenASR 排行榜上,Speech-Hands 在七个基准测试中始终以 12.1% 的 WER 优于强基线。该模型在音频问答决策上也达到了 77.37% 的准确率和高 F1 值,展现了在多样化音频问答数据集上的稳健泛化能力与可靠性。通过统一感知与决策,我们的工作为构建更可靠、更具韧性的音频智能提供了一条实用路径。
引用
@article{arxiv.2601.09413,
title = {Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception},
author = {Zhen Wan and Chao-Han Huck Yang and Jinchuan Tian and Hanrong Ye and Ankita Pasad and Szu-wei Fu and Arushi Goel and Ryo Hachiuma and Shizhe Diao and Kunal Dhawan and Sreyan Ghosh and Yusuke Hirota and Zhehuai Chen and Rafael Valle and Chenhui Chu and Shinji Watanabe and Yu-Chiang Frank Wang and Boris Ginsburg},
journal= {arXiv preprint arXiv:2601.09413},
year = {2026}
}
备注
Accepted to ACL 2026. Oral Presentation. Code: https://github.com/YukinoWan/Speech-Hands OpenClaw Branch: https://github.com/openclaw/openclaw/pull/69073