VoxInstruct:基于统一多语言编解码器语言模型的表达人类指令语音生成
计算机视觉与模式识别
2024-09-13 v2
摘要
最近的AIGC系统能够基于人类语言指令(如文本、图像和视频)生成数字多媒体内容。然而,当涉及语音时,现有方法存在两个局限:其一,需要将输入划分为内容提示(转录)和描述提示(风格和说话人),而不是直接支持人类指令。这种划分在形式上不够自然,也不符合其他AIGC模型的做法。其二,独立的描述提示用于建模语音风格,而不考虑转录内容,这限制了在细粒度层面控制语音的能力。为此,我们提出VoxInstruct,一个新的统一多语言编解码器语言建模框架,将传统文本到语音任务扩展为通用的人类指令到语音任务。我们的做法增强了人类指令引导的语音生成的表达性,使语音生成范式与其他模态保持一致。为使模型能够从原始文本指令中自动提取合成语音的内容,我们引入语音语义标记作为指令到内容指导的中间表示。我们还将多种无分类器引导(CFG)策略纳入编解码器语言模型,以增强生成语音遵循人类指令的效果。此外,我们的模型架构和训练策略允许同时支持语音提示和描述性人类指令,以实现表达语音合成,这是一种首次尝试。代码、模型和演示可在:https://github.com/thuhcsi/VoxInstruct获取。
引用
@article{arxiv.2408.15679,
title = {DEAR: Depth-Enhanced Action Recognition},
author = {Sadegh Rahmaniboldaji and Filip Rybansky and Quoc Vuong and Frank Guerin and Andrew Gilbert},
journal= {arXiv preprint arXiv:2408.15679},
year = {2024}
}
备注
5 pages, 1 figure, 1 table, accepted at Human-inspired Computer Vision, ECCV