HATS:面向自动语音识别评估的人类感知数据集
计算与语言
2026-05-06 v2
摘要
传统上,自动语音识别 (ASR) 系统的评估基于其正确识别语信号中每个单词的能力。在此背景下,词错误率 (WER) 是评估语音转录的基准指标。然而,多项研究表明该度量对于正确评估 ASR 系统的能力仍不足,因而提出了其他变体指标(加权 WER、BERTscore、语义距离等)。然而,这些指标仍偏向系统导向,尽管转录对象为人类。本文首先介绍了人类评估转录对比 (Human Assessed Transcription Side-by-side, HATS),这是一套以人类感知为基础,对法语人工标注的数据集,用以评估各种 ASR 系统产生的转录错误。143 名受试者被要求在两个假设解中选择最佳自动转录。我们研究了人类偏好与各种 ASR 评估指标之间的关系,包括词汇和嵌入基准的指标,后者据称最能与人类感知相关。
引用
@article{arxiv.2604.27542,
title = {HATS: An Open data set Integrating Human Perception Applied to the Evaluation of Automatic Speech Recognition Metrics},
author = {Thibault Bañeras Roux and Jane Wottawa and Mickael Rouvier and Teva Merlin and Richard Dufour},
journal= {arXiv preprint arXiv:2604.27542},
year = {2026}
}
备注
164--175