面向情感过渡的语音描述数据集与管道:EmoTransCap
计算与语言
2026-04-30 v1 声音
摘要
情感感知和适应性表达是人机交互的基本能力。尽管近期进展在语音情感描述(SEC)方面改进了细粒度情感建模,但现有系统局限于孤立句子中静态单情感表征,忽略了话语层面的动态情感过渡。为此,我们提出情感过渡感知语音描述(Emotion Transition-Aware Speech Captioning, EmoTransCap),一种将情感动态与话语级语音描述集成的方法。为构建富含情感过渡的数据集并支持可扩展扩张,我们设计了一个自动化的数据集创建管道。这一工作是首个专为捕获话语级情感过渡而设计的大规模数据集。为生成语义丰富的描述,我们融合话语级语音的声学属性和时间线索。我们的多任务情感过渡识别(MTETR)模型执行情感过渡检测和话语分割。利用大语言模型的语义分析能力,我们生成了描述性和指令导向两种标注版本。这些数据和标注为推进情感感知和情感表达提供了宝贵资源。数据集实现了捕获情感过渡的语音描述,促进了基于时间动态和细粒度情感理解。我们还引入了一个可控的、基于过渡的情感语音合成系统,提升了拟人化情感表达,支持情感智能对话代理。
引用
@article{arxiv.2604.26417,
title = {EmoTransCap: Dataset and Pipeline for Emotion Transition-Aware Speech Captioning in Discourses},
author = {Shuhao Xu and Yifan Hu and Jingjing Wu and Zhihao Du and Zheng Lian and Rui Liu},
journal= {arXiv preprint arXiv:2604.26417},
year = {2026}
}
备注
15 pages, 5 figures, including appendix