中文

ParaMETA:从语音中学习解耦的副语言说话风格表征

声音 2026-01-21 v1 机器学习 音频与语音处理

摘要

学习不同类型说话风格(如情感、年龄和性别)的代表性嵌入,对于识别任务(如认知计算和人机交互)和生成任务(如风格可控的语音生成)都至关重要。在这项工作中,我们引入了 ParaMETA,一个统一且灵活的框架,用于直接从语音中学习并控制说话风格。与依赖单任务模型或跨模态对齐的现有方法不同,ParaMETA 通过将语音投影到每种风格类型的专用子空间,来学习解耦的、任务特定的嵌入。这种设计减少了任务间干扰,缓解了负迁移,并允许单个模型处理多种副语言任务,如情感、性别、年龄和语言分类。除识别外,ParaMETA 还能在文本到语音(TTS)生成模型中实现细粒度的风格控制。它支持基于语音和文本的提示,并允许用户修改一种说话风格同时保留其他风格。大量实验表明,ParaMETA 在分类准确率上优于强大的基线模型,并能生成更自然、更具表现力的语音,同时保持轻量级和高效的模型,适合实际应用。

关键词

引用

@article{arxiv.2601.12289,
  title  = {ParaMETA: Towards Learning Disentangled Paralinguistic Speaking Styles Representations from Speech},
  author = {Haowei Lou and Hye-young Paik and Wen Hu and Lina Yao},
  journal= {arXiv preprint arXiv:2601.12289},
  year   = {2026}
}

备注

9 pages, 7 figures, Accepted to AAAI-26 (Main Technical Track)