中文

与机器人对话:人机交互领域语音基础模型的实用考察

机器人学 2025-08-26 v1 人工智能 计算与语言 人机交互

摘要

现实环境中的自动语音识别 (ASR) 系统需要处理不完美的音频,往往受硬件限制或环境噪声的影响,同时需要适应多样化的用户群体。在人机交互 (HRI) 中,这些挑战交织形成了独特具挑战性的识别环境。我们在八个公开数据集上评估了四个最先进的 ASR 系统,这些数据集捕捉了六个难度维度:领域特定、加音、噪声、年龄差异、受损及自发语音。我们的分析显示尽管在标准基准测试上得分相似,但这些系统在性能、幻觉倾向和固有偏见方面存在显著差异。这些局限性对 HRI 具有严重影响,因为识别错误可能干扰任务执行、影响用户信任和安全。

关键词

引用

@article{arxiv.2508.17753,
  title  = {Talking to Robots: A Practical Examination of Speech Foundation Models for HRI Applications},
  author = {Theresa Pekarek Rosin and Julia Gachot and Henri-Leon Kordt and Matthias Kerzel and Stefan Wermter},
  journal= {arXiv preprint arXiv:2508.17753},
  year   = {2025}
}

备注

Accepted at the workshop on Foundation Models for Social Robotics (FoMoSR) at ICSR 2025