SpeakEasy:增强用于表现性内容创作的文本转语音交互
人机交互
2025-04-08 v1 人工智能
机器学习
摘要
新手内容创作者通常需要投入大量时间为社交媒体视频录制表现性语音。尽管文本转语音(TTS)技术的最新进展能够生成高度逼真的各种语言和口音的语音,但许多用户仍受困于不直观或过于细碎的 TTS 界面。我们提出通过允许用户在脚本旁指定高层上下文来简化 TTS 生成。我们的 Wizard-of-Oz 系统 SpeakEasy 利用用户提供的上下文来引导并影响 TTS 输出,从而实现基于高层反馈的迭代优化。该方法得益于两项各含 8 名参与者的形成性研究:一项考察了内容创作者使用 TTS 的体验,另一项借鉴了配音演员的有效策略。我们的评估表明,使用 SpeakEasy 的参与者能更成功地生成符合其个人标准的表演,且无需比业界领先界面付出显著更多的努力。
关键词
引用
@article{arxiv.2504.05106,
title = {SpeakEasy: Enhancing Text-to-Speech Interactions for Expressive Content Creation},
author = {Stephen Brade and Sam Anderson and Rithesh Kumar and Zeyu Jin and Anh Truong},
journal= {arXiv preprint arXiv:2504.05106},
year = {2025}
}