基于离散扩散的可控重音归一化
音频与语音处理
2026-03-17 v1 人工智能
声音
摘要
现有重音归一化方法通常不提供对重音强度的控制,但许多应用(如语言学习和配音)需要可调的重音保留。我们提出DLM-AN(Controllable Accent Normalization),基于对自监督语音标记的掩码离散扩散构建可控重音归一化系统。Common Token Predictor识别可能编码本土发音的源标记,这些标记被选择性地重用于初始化逆扩散过程。这提供了一种简单而有效的控制重音强度的方法:重用更多标记可保留更多原始重音。DLM-AN还集成了flow-matching Duration Ratio Predictor,以自动调整总时长以更好匹配本土节奏。在多方言英语数据上的实验表明,DLM-AN在所有比较系统中实现了最低的词错误率,同时在可竞争的重音减少和平滑、可解释的重音强度控制方面也表现优异。
引用
@article{arxiv.2603.14275,
title = {Controllable Accent Normalization via Discrete Diffusion},
author = {Qibing Bai and Yuhan Du and Tom Ko and Shuai Wang and Yannan Wang and Haizhou Li},
journal= {arXiv preprint arXiv:2603.14275},
year = {2026}
}
备注
Submitted for review to Interspeech 2026