中文

基于边界感知信息瓶颈的可控演唱风格转换

声音 2026-04-08 v1 人工智能

摘要

本文介绍了S4团队提交至2025年演唱语音转换挑战赛(SVCC2025)的方案——一种推进细粒度风格转换与控制的演唱风格转换系统。在解决风格泄漏、动态渲染和有限数据下的高保真生成的关键挑战后,我们引入了三项核心创新:(i) 基于边界感知的Whisper瓶颈,将音素跨度表征进行池化,以抑制残余源风格同时保留语言内容;(ii) 明确的帧级技巧矩阵,辅以针对推理阶段的针对性F0处理,实现稳定且具辨识度的动态风格渲染;(iii) 感知主导的高频带补全策略,利用辅助48kHz SVC模型增强高频谱,从而在不过拟合的前提下克服数据稀缺。 在官方SVCC2025主观评估中,我们的系统在所有提交方案中实现了最佳的自然度表现,同时在说话者相似性和技巧控制方面保持竞争力,尽管使用的数据少于其他顶尖系统。音频样本已在线上提供。

关键词

引用

@article{arxiv.2604.05526,
  title  = {Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck},
  author = {Zhetao Hu and Yiquan Zhou and Wenyu Wang and Zhiyu Wu and Xin Gao and Jihua Zhu},
  journal= {arXiv preprint arXiv:2604.05526},
  year   = {2026}
}

备注

8 pages, 5 figures