DeepASMR:基于 LLM 的零样本任意语音 ASMR 语音生成
声音
2026-01-23 v1 人工智能
音频与语音处理
摘要
尽管现代文本转语音 (TTS) 系统在朗读风格语音上实现了高保真度,但它们难以生成自发性知觉经络反应 (ASMR)——一种对放松至关重要的特殊低强度语音风格。其固有挑战包括 ASMR 微妙且常为清音的特性,以及对零样本说话人自适应的需求。在本文中,我们介绍了 DeepASMR,这是首个专为零样本 ASMR 生成设计的框架。我们证明,仅需说话人普通朗读风格语音的单一短片段,即可以其声音合成高保真 ASMR,从而免去了对目标说话人耳语训练数据的需求。在方法上,我们首先发现离散语音 token 提供了对 ASMR 风格与说话人音色的软分解。利用这一洞察,我们提出了一种两阶段流水线,结合大型语言模型 (LLM) 进行内容-风格编码,并采用流匹配声学解码器进行音色重构。此外,我们贡献了 DeepASMR-DB,一个包含 670 小时的英中多说话人 ASMR 语音语料库,并引入了一种整合客观指标、人类听觉测试、基于 LLM 的评分与清音语音分析的新型评估协议。大量实验证实,DeepASMR 在为任意语音生成 ASMR 方面实现了最先进的自然度与风格保真度,同时在正常语音合成上保持了具竞争力的性能。
引用
@article{arxiv.2601.15596,
title = {DeepASMR: LLM-Based Zero-Shot ASMR Speech Generation for Anyone of Any Voice},
author = {Leying Zhang and Tingxiao Zhou and Haiyang Sun and Mengxiao Bi and Yanmin Qian},
journal= {arXiv preprint arXiv:2601.15596},
year = {2026}
}