中文

眼见为实:面向表达性语音生成的情感感知音视频语言建模

计算与语言 2025-08-29 v2 计算机视觉与模式识别 多媒体 声音 音频与语音处理

摘要

我们提出了一种音视频语言模型(AVLM),通过将全脸视觉线索集成到预训练的表达性语音模型中,实现表达性语音生成。我们在预训练阶段探索了多种视觉编码器和多模态融合策略,以确定最有效的集成方法。随后在情感识别和表达性对话任务上的微调,相比仅语音基线取得了显著提升(例如,情感识别F1值提升5)。AVLM突显了表达性视觉信息在指导语音生成中的价值,并为端到端多模态对话系统奠定了基础。

关键词

引用

@article{arxiv.2508.16188,
  title  = {Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation},
  author = {Weiting Tan and Jiachen Lian and Hirofumi Inaguma and Paden Tomasello and Philipp Koehn and Xutai Ma},
  journal= {arXiv preprint arXiv:2508.16188},
  year   = {2025}
}

备注

EMNLP 2025 (Findings)