中文

通过 GFlowNets 实现 LM-based TTS 模型中幻觉消除的分布对齐

音频与语音处理 2025-09-08 v3 人工智能 声音

摘要

基于语言模型(LM)的文本到语音(TTS)系统常会生成偏离输入文本的幻觉语音。现有消除策略要么需要大量训练资源,要么会引入显著的推理延迟。本文提出 GFlOwNet-guided distribution AlignmenT(GOAT)用于 LM-based TTS,一种无需大量资源或推理成本的后训练框架,用于消除幻觉。具体而言,我们首先进行不确定性分析,揭示幻觉与模型不确定性之间存在强正相关。基于此,我们将 TTS 生成问题重新表述为轨迹流优化问题,引入增强的子轨迹平衡目标目标,并锐化内部奖励作为目标分布。进一步集成奖励温度衰减和学习率优化以实现稳定性与性能的平衡。大量实验表明,GOAT 在挑战性测试案例中将字符错误率降低超过50%,将不确定性降低最高可达58%,显示出强大的泛化能力和效果。

关键词

引用

@article{arxiv.2508.15442,
  title  = {Mitigating Hallucinations in LM-Based TTS Models via Distribution Alignment Using GFlowNets},
  author = {Chenlin Liu and Minghui Fang and Patrick Zhang and Wei Zhou and Jie Gao and Jiqing Han},
  journal= {arXiv preprint arXiv:2508.15442},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Main Conference (Oral)