SP-MCQA: 评估语音合成技术中超越单词层面的可理解性
声音
2025-10-31 v1 计算与语言
音频与语音处理
摘要
语音合成技术的可理解性评估已陷入瓶颈,因为现有评估方法过度依赖单词级别的准确度指标,如 WER,这些指标未能捕捉现实场景下语音的复杂性,也未能反映人类理解需求。为此,我们提出了口语段落多选问答(Spoken-Passage Multiple-Choice Question Answering,SP-MCQA),这是一种新型主观方法,用于评估合成语音中关键信息的准确性,并发布了用于 SP-MCQA 评估的 8.76 小时新闻风格基准数据集(SP-MCQA-Eval)。我们的实验表明,低 WER 并不一定保证高的关键信息准确性,暴露了传统指标与实际可理解性之间的鸿沟。SP-MCQA 显示,甚至是最先进(SOTA)模型在文本规范化和语音学准确性方面仍不足。本工作凸显,随着许多系统已在 WER 上取得优异表现,但可能在实际可理解性方面仍有不足,亟需一种更高层次、更贴近现实的评估标准。
关键词
引用
@article{arxiv.2510.26190,
title = {SP-MCQA: Evaluating Intelligibility of TTS Beyond the Word Level},
author = {Hitomi Jin Ling Tee and Chaoren Wang and Zijie Zhang and Zhizheng Wu},
journal= {arXiv preprint arXiv:2510.26190},
year = {2025}
}