Affectron:基于情感感知与情境对齐的非语言语音合成
声音
2026-04-22 v2
摘要
非语言语音(nonverbal vocalizations, NVs),如笑声和叹气,是情感语音合成中表达情感线索的核心元素。然而,在开放环境中学习多样且与情境对齐的NVs仍然具有挑战性,这是由于NV数据有限以及缺乏明确监督所致。为了回应这一挑战,我们提出Affectron作为情感且情境对齐NV生成的框架。基于小规模开放且解耦的语料库,Affectron引入NV增强训练策略,以扩充NV类型的分布和插入位置。我们进一步将NV结构遮蔽(NV structural masking)融入基于纯 verbal speech 预训练的语音 backbone,以实现NV的多样性和自然性。实验结果表明,Affectron生成的NV在表现力和多样性方面优于基线系统,同时保持了 verbal speech 流的自然性。
引用
@article{arxiv.2603.14432,
title = {Affectron: Emotional Speech Synthesis with Affective and Contextually Aligned Nonverbal Vocalizations},
author = {Deok-Hyeon Cho and Hyung-Seok Oh and Seung-Bin Kim and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2603.14432},
year = {2026}
}
备注
Accepted to Findings of ACL 2026