MGSC:面向稳健端到端语音识别的多粒度一致性框架
计算与语言
2025-08-25 v1 人工智能
声音
音频与语音处理
摘要
尽管端到端语音识别模型在基准测试中取得了成功,但在嘈杂环境下常产生灾难性语义错误。我们认为,这种脆弱性源于主流的“直接映射”目标——该目标仅惩罚最终输出错误,却未约束模型内部计算过程。为此,我们提出多粒度软一致性(MGSC)框架,一种模型无关、即插即用的数据模块,通过同时正则化宏观层次句子语义和微观层次token对齐来强制内部自我一致性。关键在于,我们首次发现这两种一致性粒度之间存在强大的协同效应:联合优化可显著优于单独贡献。实验表明,在多种嘈杂条件下,MGSC将平均字符错误率(charater error rate)降低了8.7%,主要通过防止严重语义改变的错误来实现。我们的工作表明,强化内部一致性是构建更稳健和值得信赖AI的关键步骤。
引用
@article{arxiv.2508.15853,
title = {MGSC: A Multi-granularity Consistency Framework for Robust End-to-end Asr},
author = {Xuwen Yang},
journal= {arXiv preprint arXiv:2508.15853},
year = {2025}
}
备注
12 pages, 5figures