中文

TARQ:面向罕见词鲁棒自动语音识别的尾部感知重建量化

计算与语言 2026-05-28 v1 多媒体

摘要

数据感知的训练后量化(PTQ)在小型校准语料库上最小化逐词元(per-token)重建损失,隐式地根据经验频率对位置进行加权。对于自动语音识别(ASR),这与对尾部敏感的风险不一致:姓名、数字和领域特定词获得的校准质量比例过小。我们提出了尾部感知重建量化(TARQ),一个无标签的PTQ框架,通过\rareBAL(一个封闭形式的逐线性层规则,用于均衡常见/尾部质量)将校准转向词汇尾部,并配以度量一致的残差校正。TARQ不需要实体标签、不需要精心设计的校准集、不需要验证解码,也不需要额外训练。在八个ASR骨干网络和六个数据集上,在W4G128设置下,TARQ在不引起聚合词错误率(aggregate-WER)回归的情况下改善了平均罕见词错误率(rare-WER),在比较方法中实现了最低的跨语料库rare-WER波动,并且无需实体监督即可迁移到富含实体的基准(ProfASR, ContextASR-Speech-En)。

关键词

引用

@article{arxiv.2605.27808,
  title  = {TARQ: Tail-Aware Reconstruction Quantization for Rare-Word Robust Automatic Speech Recognition},
  author = {Xinyu Wang and Ziyu Zhao and Ke Bai and Silin Meng and Dongming Shen and Xiao-Wen Chang and Yixuan HE},
  journal= {arXiv preprint arXiv:2605.27808},
  year   = {2026}
}