面向漫画的情感感知语音生成(角色专属音色)
声音
2025-09-22 v1 人工智能
多媒体
音频与语音处理
摘要
本文提出了一种从漫画生成角色专属、情感感知语音的端到端流水线。该系统以完整漫画卷为输入,生成与每个角色对话及其情感状态对齐的语音。图像处理模块执行角色检测、文本识别和情感强度识别。大型语言模型通过整合视觉信息与不断发展的剧情上下文,完成对话归属与情感分析。语音通过文本转语音模型合成,该模型为每个角色和每种情感配置了独立的音色档案。本工作实现了漫画的自动配音生成,为交互式和沉浸式漫画阅读体验迈出了一步。
引用
@article{arxiv.2509.15253,
title = {Emotion-Aware Speech Generation with Character-Specific Voices for Comics},
author = {Zhiwen Qian and Jinhua Liang and Huan Zhang},
journal= {arXiv preprint arXiv:2509.15253},
year = {2025}
}