CALM:面向多说话人语音识别的联合语境声学-语言建模框架
音频与语音处理
2026-05-14 v2 计算与语言
声音
摘要
我们提出CALM(Contextual Acoustic-Linguistic Modeling),一个用于多说话人自动语音识别(ASR)的联合语境声学-语言建模框架。在个性化AI场景中,声学线索与语言线索的联合可用性自然促使将目标说话人条件化与重叠对话中的语境制导相结合。CALM通过说话人嵌入驱动的目标说话人提取和基于动态词汇的语境制导,在端到端框架中实现了这种集成。我们在模拟的英语(LibriSpeechMix)和日文(CSJMix)语料上评估了CALM。在两说话人混合语音上,CALM将有偏词错误率(B-WER)从12.7降至4.7(LibriSpeech2Mix),将有偏字符错误率(B-CER)从16.6降至8.4(CSJMix2 eval3),展示了跨语言联合声学-语言建模的有效性。我们还在AMI语料(IHM-mix条件)上报告了结果,以验证在标准化语音混合物上的性能。
引用
@article{arxiv.2601.22792,
title = {CALM: Joint Contextual Acoustic-Linguistic Modeling for Personalization of Multi-Speaker ASR},
author = {Muhammad Shakeel and Yosuke Fukumoto and Chikara Maeda and Chyi-Jiunn Lin and Shinji Watanabe},
journal= {arXiv preprint arXiv:2601.22792},
year = {2026}
}
备注
Accepted to IEEE ICASSP 2026