与机器人对话:人机交互领域语音基础模型的实用考察
机器人学
2025-08-26 v1 人工智能
计算与语言
人机交互
摘要
现实环境中的自动语音识别 (ASR) 系统需要处理不完美的音频,往往受硬件限制或环境噪声的影响,同时需要适应多样化的用户群体。在人机交互 (HRI) 中,这些挑战交织形成了独特具挑战性的识别环境。我们在八个公开数据集上评估了四个最先进的 ASR 系统,这些数据集捕捉了六个难度维度:领域特定、加音、噪声、年龄差异、受损及自发语音。我们的分析显示尽管在标准基准测试上得分相似,但这些系统在性能、幻觉倾向和固有偏见方面存在显著差异。这些局限性对 HRI 具有严重影响,因为识别错误可能干扰任务执行、影响用户信任和安全。
引用
@article{arxiv.2508.17753,
title = {Talking to Robots: A Practical Examination of Speech Foundation Models for HRI Applications},
author = {Theresa Pekarek Rosin and Julia Gachot and Henri-Leon Kordt and Matthias Kerzel and Stefan Wermter},
journal= {arXiv preprint arXiv:2508.17753},
year = {2025}
}
备注
Accepted at the workshop on Foundation Models for Social Robotics (FoMoSR) at ICSR 2025