中文

TAVID:面向文本驱动的音视频交互式对话生成

计算机视觉与模式识别 2025-12-24 v1 人工智能 音频与语音处理 图像与视频处理

摘要

本文旨在从文本和参考图像中联合合成交互式视频和对话式语音。以构建类人类交互系统为最终目标,近期研究探索了说话人或听话人生成以及对话式语音生成。然而,这些工作通常在孤立环境中进行,忽略了人类对话的多模态特性,即音视频交互紧密耦合。本文引入TAVID,一个统一框架,同步生成交互式面部表情和对话语音。TAVID通过两个跨模态映射器(即运动映射器和说话人映射器)集成面部生成与语音生成管道,实现音视频模态之间双向互换互补信息。我们在四个维度上评估了该系统:说话面部真实性、听话人响应性、双人交互流畅性和语音质量。广泛实验表明,我们的方法在所有方面均表现出色。

关键词

引用

@article{arxiv.2512.20296,
  title  = {TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation},
  author = {Ji-Hoon Kim and Junseok Ahn and Doyeop Kwak and Joon Son Chung and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2512.20296},
  year   = {2025}
}

备注

Project page: https://mm.kaist.ac.kr/projects/TAVID