眼见为实:面向表达性语音生成的情感感知音视频语言建模
计算与语言
2025-08-29 v2 计算机视觉与模式识别
多媒体
声音
音频与语音处理
摘要
我们提出了一种音视频语言模型(AVLM),通过将全脸视觉线索集成到预训练的表达性语音模型中,实现表达性语音生成。我们在预训练阶段探索了多种视觉编码器和多模态融合策略,以确定最有效的集成方法。随后在情感识别和表达性对话任务上的微调,相比仅语音基线取得了显著提升(例如,情感识别F1值提升5)。AVLM突显了表达性视觉信息在指导语音生成中的价值,并为端到端多模态对话系统奠定了基础。
引用
@article{arxiv.2508.16188,
title = {Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation},
author = {Weiting Tan and Jiachen Lian and Hirofumi Inaguma and Paden Tomasello and Philipp Koehn and Xutai Ma},
journal= {arXiv preprint arXiv:2508.16188},
year = {2025}
}
备注
EMNLP 2025 (Findings)