中文

MGSC:面向稳健端到端语音识别的多粒度一致性框架

计算与语言 2025-08-25 v1 人工智能 声音 音频与语音处理

摘要

尽管端到端语音识别模型在基准测试中取得了成功,但在嘈杂环境下常产生灾难性语义错误。我们认为,这种脆弱性源于主流的“直接映射”目标——该目标仅惩罚最终输出错误,却未约束模型内部计算过程。为此,我们提出多粒度软一致性(MGSC)框架,一种模型无关、即插即用的数据模块,通过同时正则化宏观层次句子语义和微观层次token对齐来强制内部自我一致性。关键在于,我们首次发现这两种一致性粒度之间存在强大的协同效应:联合优化可显著优于单独贡献。实验表明,在多种嘈杂条件下,MGSC将平均字符错误率(charater error rate)降低了8.7%,主要通过防止严重语义改变的错误来实现。我们的工作表明,强化内部一致性是构建更稳健和值得信赖AI的关键步骤。

关键词

引用

@article{arxiv.2508.15853,
  title  = {MGSC: A Multi-granularity Consistency Framework for Robust End-to-end Asr},
  author = {Xuwen Yang},
  journal= {arXiv preprint arXiv:2508.15853},
  year   = {2025}
}

备注

12 pages, 5figures