中文

HATS:面向自动语音识别评估的人类感知数据集

计算与语言 2026-05-06 v2

摘要

传统上,自动语音识别 (ASR) 系统的评估基于其正确识别语信号中每个单词的能力。在此背景下,词错误率 (WER) 是评估语音转录的基准指标。然而,多项研究表明该度量对于正确评估 ASR 系统的能力仍不足,因而提出了其他变体指标(加权 WER、BERTscore、语义距离等)。然而,这些指标仍偏向系统导向,尽管转录对象为人类。本文首先介绍了人类评估转录对比 (Human Assessed Transcription Side-by-side, HATS),这是一套以人类感知为基础,对法语人工标注的数据集,用以评估各种 ASR 系统产生的转录错误。143 名受试者被要求在两个假设解中选择最佳自动转录。我们研究了人类偏好与各种 ASR 评估指标之间的关系,包括词汇和嵌入基准的指标,后者据称最能与人类感知相关。

关键词

引用

@article{arxiv.2604.27542,
  title  = {HATS: An Open data set Integrating Human Perception Applied to the Evaluation of Automatic Speech Recognition Metrics},
  author = {Thibault Bañeras Roux and Jane Wottawa and Mickael Rouvier and Teva Merlin and Richard Dufour},
  journal= {arXiv preprint arXiv:2604.27542},
  year   = {2026}
}

备注

164--175