中文

SonoEdit:面向TTS中发音纠错的空旷空间约束知识编辑

声音 2026-01-27 v1 人工智能 音频与语音处理

摘要

神经文本语音(TTS)系统在发音低资源专有名词时存在系统性误差,尤其是非英语姓名、品牌和地理位置,因为它们在以英语为主的训练语料中欠 représent。现有解决方案通常依赖高昂的多语言数据收集、监督微调或手动语音标注,这限制了TTS系统在语言多样化环境中的部署。我们引入 SonoEdit,一种用于预训练TTS模型中发音错误的模型编辑技术,通过手术式纠正而无需重新训练。不同于高昂的微调或显式音素注入,我们提出一种简约替代方案,基于空旷空间发音编辑,该技术通过单次参数更新纠正特定单词的发音,同时以数学方式保证保留模型的其他所有行为。我们首先采用声学因果追踪法识别负责文本到发音映射的Transformer层。随后应用空旷空间受约束编辑计算出闭式权重更新,以纠正目标发音同时保持与一般语音生成子空间的正交性。该受约束更新将模型的声学输出引向所需的发音示例,同时保证在保存语料库上的零一阶变化。

关键词

引用

@article{arxiv.2601.17086,
  title  = {SonoEdit: Null-Space Constrained Knowledge Editing for Pronunciation Correction in LLM-Based TTS},
  author = {Ayush Pratap Singh and Harshit Singh and Nityanand Mathur and Akshat Mandloi and Sudarshan Kamath},
  journal= {arXiv preprint arXiv:2601.17086},
  year   = {2026}
}