CustomListener:用于用户友好倾听头生成的文本引导响应式交互
计算机视觉与模式识别
2024-04-01 v2 声音
音频与语音处理
摘要
倾听头生成旨在通过对动态对话中说话者与倾听者之间的相关性建模,合成非语言响应的倾听者头部。倾听者代理生成在虚拟交互中的应用促进了许多工作实现了多样化和细粒度的运动生成。然而,它们只能通过简单的情感标签操纵运动,无法自由控制倾听者的运动。由于倾听者代理应具有人类般的属性(例如身份、个性),且这些属性应可由用户自由定制,这限制了它们的真实感。在本文中,我们提出了一种名为 CustomListener 的用户友好框架,以实现自由形式文本先验引导的倾听者生成。为了实现说话者 - 倾听者协调,我们设计了一个静态到动态肖像模块 (SDP),该模块与说话者信息交互,将静态文本转换为具有完成节奏和幅度信息的动态肖像令牌。为了实现片段之间的连贯性,我们设计了一个过去引导生成模块 (PGG),以通过运动先验保持定制倾听者属性的一致性,并利用基于扩散的结构(以肖像令牌和运动先验为条件)来实现可控生成。为了训练和评估我们的模型,我们基于 ViCo 和 RealTalk 构建了两个带有文本注释的倾听头数据集,提供了文本 - 视频配对标签。大量实验验证了我们模型的有效性。
引用
@article{arxiv.2403.00274,
title = {CustomListener: Text-guided Responsive Interaction for User-friendly Listening Head Generation},
author = {Xi Liu and Ying Guo and Cheng Zhen and Tong Li and Yingying Ao and Pengfei Yan},
journal= {arXiv preprint arXiv:2403.00274},
year = {2024}
}
备注
Accepted by CVPR 2024