视觉上下文能否改善具身智能体的自动语音识别?
音频与语音处理
2022-10-25 v1 人工智能
计算与语言
计算机视觉与模式识别
机器学习
机器人学
摘要
自动语音识别(ASR)系统的使用正变得无处不在,从个人助理到聊天机器人、家庭与工业自动化系统等。现代机器人也配备 ASR 能力以与人类交互,因为语音是最自然的交互模态。然而,相较于个人助理,机器人中的 ASR 面临额外挑战。作为具身智能体,机器人必须识别其周围的物理实体,从而可靠地识别包含此类实体描述的语音。然而,由于 ASR 训练中的局限(如通用数据集与开放词汇建模),当前 ASR 系统往往无法做到这一点。此外,推理过程中的不利条件(如噪声、口音与远场语音)使转写不准确。本工作中,我们提出一种将机器人视觉信息融入 ASR 系统的方法,以改进对包含可见实体的口语句子的识别。具体而言,我们提出一种新的解码器偏置技术以融入视觉上下文,同时确保 ASR 输出不会因错误上下文而退化。我们实现了相较未修改 ASR 系统 59% 的 WER 相对降低。
引用
@article{arxiv.2210.13189,
title = {Can Visual Context Improve Automatic Speech Recognition for an Embodied Agent?},
author = {Pradip Pramanick and Chayan Sarkar},
journal= {arXiv preprint arXiv:2210.13189},
year = {2022}
}
备注
Accepted in EMNLP '22